SheepNav
新上线今天0 投票

HeadGuard:为低比特 VLM KV 缓存量化提供选择性注意力头保护

低比特 KV 缓存量化能显著节省显存,却往往让视觉语言模型(VLM)的准确率断崖式下跌。一篇新论文提出了 HeadGuard,一种可组合的注意力头保护方案,试图在不更换底层量化器的前提下,把丢失的精度「捞」回来。

问题出在哪里

VLM 在处理图文混合输入时,KV 缓存的体积会随图像 token 数量迅速膨胀,成为推理显存的主要负担。把缓存压到 2 bit、3 bit 是常见思路,但论文指出:低比特量化对 VLM 的伤害远比对纯文本 LLM 更明显,因为视觉 token 的键值分布更不均匀,一刀切量化会直接破坏跨模态对齐能力。

HeadGuard 的做法

HeadGuard 的核心思路很朴素——不是所有注意力头都同等重要,那就别让它们一起「降级」。

  • 通过 图像敏感度(image-sensitivity) 与 输出敏感度(output-sensitivity) 两个离线评分,挑选出对视觉信息最关键的物理 KV 头;
  • 主实验中约 1/8 的注意力头被纳入保护名单;
  • 被保护的头,其图像 key(以及可选的 value)继续以 bfloat16(BF16) 高精度保存,其余未保护条目则交给基础量化器压缩。

由于保护掩码是固定且离线的,HeadGuard 可以叠加在任意基础量化器之上,属于「即插即用」的增强层,而非替代方案。

实验数据

论文在 8 个 VLM、3 种基础量化器和 8 个基准(6 个判别式 + 2 个生成式) 上做了评估,结果包括:

  • 在 2 bit 设置下,最弱基础量化器的六任务判别式平均分从 0.436 提升到 0.580;
  • Qwen 与 InternVL 系列收益最为明显;
  • 保护机制还能改善生成式回答质量,以及图像描述与 BF16 输出的保真度;
  • 在三类量化器、两套校准数据集上,平均精度增益均可复现;
  • 仅保护 key 的轻量版本在更低存储成本下仍保留大部分恢复效果。

值得注意的边界

需要强调的是,论文中的评估基于模拟量化,并非真实硬件部署下的实测结果,因此实际推理加速与显存收益仍需进一步验证。此外,1/8 的保护比例是主实验设定,最优比例可能随模型规模与任务类型变化。

一句话总结

HeadGuard 提供了一条务实路线:与其重新设计量化算法,不如精准识别哪些注意力头不能碰,用极小的精度预算换取大幅的准确率回升。对需要在边缘设备或低成本 GPU 上部署 VLM 的团队来说,这是一个低侵入性的可选组件。

延伸阅读

  1. Google 发布 Gemini 4 Argon,号称迄今最强模型,专攻网络安全与编程
  2. AI硬件设计新星Flow Engineering获5000万美元B轮融资,估值达7.5亿美元
  3. Google 发布 Gemini 4,宣称能力过强仅限“可信网络防御者”使用
查看原文