Preprint
Jul 2026
Variable Bit-width Quantization: Learning Per-Group Precision for"Bigger-but-Smaller"Language Models
Variable Bit-width Quantization (VBQ), a training-time method in which each contiguous group of 64 weights learns its own resolution from {1,2,4,8} bits via a Gumbel-Softmax relaxation, is introduced, trained jointly by an alternating optimization that gives the precision logits a clean, task-aligned signal.
H. Ogilvy
· 0 citations