SheepNav
新上线今天0 投票

DAMP:衰减感知的混合精度循环状态量化方案

近年来,大型语言模型(LLM)在推理时的内存开销成为关键瓶颈。传统Softmax注意力机制需要为每个前序token存储键值向量,导致内存随序列长度线性增长。为缓解这一问题,Gated DeltaNet(GDN)和Kimi Delta Attention(KDA)等新型架构在多数层中用固定大小的循环状态替代KV缓存,大幅降低了推理内存。然而,这些循环状态通常以FP32格式存储,占用大量GPU显存,且其更新过程受内存带宽限制,显著拖慢解码速度。

针对这一痛点,来自阿里巴巴等机构的研究团队提出了DAMP(Decay-Aware Mixed-Precision Recurrent-State Quantization),首次系统研究了GDN和KDA模型中循环状态的后训练量化问题。该研究已提交至arXiv(编号2608.27513)。

研究发现,简单的均匀量化难以在精度和存储之间取得平衡:INT8和FP8格式在复杂推理任务上已导致精度下降,而INT4和NVFP4格式几乎使模型性能归零。进一步分析揭示,量化误差能量高度集中在少数通道上,且这些通道的相对衰减强度在不同提示和任务间保持稳定。基于此,DAMP在离线校准阶段结合量化误差能量和基于衰减的持久性来识别高风险通道,对这些通道采用更高精度存储,其余通道则使用INT8。

实验在Qwen3.6-35B和Kimi-Linear-48B两个模型上进行,覆盖数学推理、通用推理和代码生成六项基准。结果显示,在每状态值9.9比特的设定下,DAMP的平均精度接近FP32基线,同时将循环状态存储减少69.1%,循环状态更新内核加速最高达2.01倍,全模型单token输出时间(TPOT)降低最高10.9%

这项研究为混合精度量化在新型注意力架构中的应用提供了新思路,尤其对长序列推理场景的部署优化具有重要意义。不过,该论文目前仍为预印本,尚未经过同行评审,其方法在实际硬件上的泛化能力有待进一步验证。

延伸阅读

  1. 曲率感知的自适应最近邻分类:CARSANN 框架
  2. 自解释多标签图神经网络:为关联证据归因而生
  3. Dandelion:球面神经模拟行星动力学的新方法
查看原文