新上线今天0 投票
REAL-Q:通过动态梯度下降实现端到端大语言模型量化
REAL-Q:打破PTQ近似困境,实现端到端量化新范式
大语言模型(LLM)在资源受限环境下的部署离不开后训练量化(PTQ)技术。然而,现有最先进的PTQ方法通常采用闭式二阶求解器逐层量化,为了保持解析可处理性,它们不得不大幅近似全局损失,例如忽略跨通道耦合、将输出行分组等,并冻结整个层的Hessian矩阵。这导致量化过程中无法根据损失景观的变化动态调整,引发所谓的“信息错位”问题。
针对这一瓶颈,来自多家机构的研究团队提出了REAL-Q(Real-time E2E-loss Aligned LLM Quantization),一种全新的PTQ范式。REAL-Q不再为了解析简便而稀释目标,而是直接对准端到端损失的替代目标,并通过细粒度的动态块级梯度下降(每128列一个块)进行优化。同时,引入滑动窗口机制实现跨层的平滑过渡,有效抑制误差在网络中的传播。
实验表明,在LLaMA-3.1(8B和70B)和Qwen3(0.6B-32B)模型上,采用W4A16量化配置时,REAL-Q相比现有全局引导方法,将端到端KL散度降低高达49%。这一显著提升证明了REAL-Q在保持高效性的同时,能够更精准地逼近原始模型性能。
REAL-Q的提出为LLM量化领域提供了新的思路:不再依赖静态近似,而是通过动态优化实时对齐全局损失,从而在极低比特量化下实现更高的模型保真度。该研究已发布在arXiv上(编号2609.00049),并附有代码和实验细节,为后续研究提供了坚实基础。