LILA: Calibration-Free Structured Pruning of Large Language Models via Latent Spectral Geometry
Extending LILA to dynamically allocate sparsity budgets via KS-scores yields state-of-the-art generative preservation at moderate compression, while uncovering fundamental single-layer architectural bottlenecks at higher compression regimes.
Sankar Behera, D. Singh, Anshika Agnihotri et al.
· 0 citations