AttSVD:用注意力几何做免训练KV缓存压缩,内存减半不掉点
长上下文的第一道成本墙:KV 缓存
自回归 Transformer 的 KV 缓存随上下文长度线性增长,在长上下文场景下已经超过模型权重本身,成为显存占用的主要来源。围绕这一瓶颈,业界主流思路是「丢 token」:识别低重要性 token 并将其逐出。但 Hugging Face 收录的新论文 AttSVD(arXiv:2610.06927)指出,这一选择沿序列轴进行,一旦丢弃就不可逆——被删掉的信息再也没有机会找回。
论文作者 Sara Abdali、Jongwoo Ko、Pashmina Cameron 换了一条轴:保留全部 token,转而在特征维度上把每个 token 存得更便宜。
核心做法:让注意力自己决定压缩基
AttSVD 是一种免训练的低秩压缩方法,其压缩基并非预先固定,而是来自每个 prompt 自身的注意力几何结构:
- 对每个 prompt 在线执行截断 SVD;
- 只保留注意力真正读取的方向;
- 每头持久 KV 内存的削减量与保留秩成正比。
由于基向量由注意力分布推导而来,论文将其称为一种「可解释」的压缩——每个头实际消耗的有效秩与几何形态可以直接读出,相当于免费获得一份逐头的诊断视图。
两种解码策略与两项自适应改进
针对不同生成场景,作者给出两套 decode 阶段的缓存策略:
- accumulating(累积式):面向短生成;
- streaming(流式):面向长生成。
同时加入两项让压缩更具适应性的改进:
- 逐矩阵能量规则:分别对 logit 空间与注意力质量进行尺寸设定,避免用同一尺度粗暴处理两类空间;
- 注意力感知的基截断:只在注意力真正读取的空间中截断,从而同时保住 注意力 logits 与注意力输出。
效果:一半内存,性能对齐稠密缓存
论文在多个模型上、覆盖一个 agentic 基准与完整的 LongBench 套件进行了验证。结果显示,AttSVD 在使用最多 50% KV 缓存内存的情况下,性能与稠密缓存基本持平。
为什么值得关注
长上下文推理的成本结构正在从「算力受限」转向「显存受限」,KV 缓存压缩因此成为推理优化的关键战场。与逐出式方法相比,AttSVD 的价值在于不做不可逆的信息删除,而是把压缩从序列轴搬到特征轴;其逐头可解释性也为后续的秩分配策略留出了空间。
需要说明的是,当前信息来自论文摘要与 arXiv 元数据,具体的吞吐提升、不同模型上的逐项得分与实现开销尚未在本文中展开,实际部署收益仍待完整论文与后续复现验证。
