SheepNav
新上线今天0 投票

AttSVD:用注意力几何做免训练KV缓存压缩,内存减半不掉点

长上下文的第一道成本墙:KV 缓存

自回归 Transformer 的 KV 缓存随上下文长度线性增长,在长上下文场景下已经超过模型权重本身,成为显存占用的主要来源。围绕这一瓶颈,业界主流思路是「丢 token」:识别低重要性 token 并将其逐出。但 Hugging Face 收录的新论文 AttSVD(arXiv:2610.06927)指出,这一选择沿序列轴进行,一旦丢弃就不可逆——被删掉的信息再也没有机会找回。

论文作者 Sara Abdali、Jongwoo Ko、Pashmina Cameron 换了一条轴:保留全部 token,转而在特征维度上把每个 token 存得更便宜。

核心做法:让注意力自己决定压缩基

AttSVD 是一种免训练的低秩压缩方法,其压缩基并非预先固定,而是来自每个 prompt 自身的注意力几何结构:

  • 对每个 prompt 在线执行截断 SVD;
  • 只保留注意力真正读取的方向;
  • 每头持久 KV 内存的削减量与保留秩成正比。

由于基向量由注意力分布推导而来,论文将其称为一种「可解释」的压缩——每个头实际消耗的有效秩与几何形态可以直接读出,相当于免费获得一份逐头的诊断视图。

两种解码策略与两项自适应改进

针对不同生成场景,作者给出两套 decode 阶段的缓存策略:

  • accumulating(累积式):面向短生成;
  • streaming(流式):面向长生成。

同时加入两项让压缩更具适应性的改进:

  1. 逐矩阵能量规则:分别对 logit 空间与注意力质量进行尺寸设定,避免用同一尺度粗暴处理两类空间;
  2. 注意力感知的基截断:只在注意力真正读取的空间中截断,从而同时保住 注意力 logits 与注意力输出。

效果:一半内存,性能对齐稠密缓存

论文在多个模型上、覆盖一个 agentic 基准与完整的 LongBench 套件进行了验证。结果显示,AttSVD 在使用最多 50% KV 缓存内存的情况下,性能与稠密缓存基本持平。

为什么值得关注

长上下文推理的成本结构正在从「算力受限」转向「显存受限」,KV 缓存压缩因此成为推理优化的关键战场。与逐出式方法相比,AttSVD 的价值在于不做不可逆的信息删除,而是把压缩从序列轴搬到特征轴;其逐头可解释性也为后续的秩分配策略留出了空间。

需要说明的是,当前信息来自论文摘要与 arXiv 元数据,具体的吞吐提升、不同模型上的逐项得分与实现开销尚未在本文中展开,实际部署收益仍待完整论文与后续复现验证。

延伸阅读

  1. ChatGPT 上线「智能界面」:回复里直接塞满图表、按钮和交互组件
  2. Claude Haiku 5.5 登陆 AWS:速度最快、成本降低 75% 的 Claude 模型
  3. 三款AI大模型实测开车:只有Claude成功把丰田卡罗拉开到In-N-Out
查看原文