预测中间层注意力:多模态大模型视觉标记剪枝新方法
多模态大语言模型(MLLMs)在各类视觉-语言任务中表现出色,但其推理效率受制于大量视觉标记的处理开销。视觉标记剪枝能有效降低计算成本,但前提是准确评估每个标记的重要性。近期研究显示,语言模型中层的文本到视觉注意力可作为剪枝的有效指导,通常的做法是选取一个固定的中间层,利用其注意力分数筛选需要保留的视觉标记。然而,这种方法存在两个关键问题:其一,不同样本所对应的最优注意力层差异显著,固定层难以适应所有情况;其二,获取中间层注意力需要先处理大量视觉标记,计算开销已经产生,削弱了剪枝带来的收益。
针对上述挑战,来自北京航空航天大学等机构的研究团队提出了一种名为 Middle-layer Attention Prediction(MAP) 的方法。MAP 的核心创新在于引入“问题对比教师选择”机制:通过对比原始问题和参考问题下的注意力差异,为每个样本动态挑选最合适的教师层,再将该层的注意力知识蒸馏到一个轻量级预测器中。该预测器能够直接从多模态输入特征中估算视觉标记的重要性,无需实际计算注意力图。在推理阶段,MAP 结合预测的重要性分数与多样性准则,在进入语言模型第一层之前就完成视觉标记的剪枝,从而与现有的推理加速技术无缝兼容。
在 LLaVA-NeXT-7B 模型上的十项基准测试中,MAP 仅保留 5.56% 的视觉标记,便维持了未剪枝模型 97.5% 的性能,同时实现了 3.09 倍 的端到端加速。这一结果表明,MAP 在保持模型性能的同时显著提升了推理效率,为多模态大模型在实际场景中的部署提供了新的可能性。
深度解析:为什么固定层不可靠?
传统方法依赖固定的中间层注意力,但研究团队通过分析发现,不同样本对注意力层的敏感性差异极大。例如,在回答“图中有什么颜色?”这类简单问题时,浅层注意力可能已足够;而面对“图中的物体在做什么?”这类复杂推理时,深层注意力才更有效。因此,固定层往往只能覆盖部分样本,导致剪枝效果不稳定。
MAP 的解决之道:动态教师 + 轻量预测
MAP 通过对比原始问题与参考问题(如“描述这张图片”)的注意力差异,识别出对当前问题最敏感的层,将其作为教师。随后,通过知识蒸馏,将教师层的注意力模式压缩进一个轻量预测器,该预测器直接由多模态输入特征生成重要性分数。这样一来,推理时无需计算任何注意力图,极大减少了计算负担。
实际应用与前景
MAP 的设计使其易于集成到现有 MLLMs 中,且不干扰其他加速技术(如 KV 缓存压缩)。未来,该方法有望成为多模态模型高效推理的标准组件,尤其适用于图像密集、需要实时响应的应用场景,如自动驾驶、智能助手等。不过,研究者也指出,当前方法在极端剪枝率下的性能保持仍有待提升,未来将探索更精细的多样性控制策略。
总之,MAP 通过动态选择教师层和轻量预测,有效解决了视觉标记剪枝中的关键痛点,为多模态大模型的效率优化提供了新思路。