SheepNav
新上线今天0 投票

无需训练的知识迁移:激活引导剪枝实现跨规模模型融合

在AI领域,模型规模的差异往往成为知识迁移的障碍。通常,将大型模型的能力迁移到小型模型需要复杂的对齐或训练过程。然而,一项新研究提出了一种无需训练的跨规模融合方法,通过激活引导的剪枝技术,在保持性能的同时实现知识的高效转移。

创新方法:Activation-Prune-Merge (APM)

来自研究者的一项新工作提出了 Activation-Prune-Merge (APM) 框架,旨在解决异构模型融合中的跨规模问题。传统方法通常需要神经元级别的语义对齐,而APM则另辟蹊径。它通过构建任务条件下的激活图,识别大型模型(供体)中与任务相关的关键部分,然后进行剪枝以匹配小型模型(受体)的架构。具体来说,APM会剪枝供体的层、隐藏维度、注意力头和MLP神经元,使其与受体的结构对齐,最后通过微小的插值系数将剪枝后的供体部分注入受体。

这种方法的核心思想是,将供体视为功能组件的集中来源,而非要求精确的结构移植。这种设计使得跨规模融合无需显式的语义对齐,就能实现知识转移。

显著性能提升

研究者在16个基准测试上进行了评估,涵盖推理、数学、代码生成、指令遵循和分类等任务。结果显示,APM将3B规模受体的平均准确率从 55.5% 提升至 60.6%。在具体任务上,RTE准确率从64.3%大幅提升至82.3%,QNLI从52.3%提升至65.7%,BoolQ从70.8%提升至79.2%。这些数据表明,激活引导的剪枝能够有效提取供体中的可迁移能力。

分析与未来方向

研究还分析了注入比例的影响,并探索了多阶段顺序融合的可能性。结果表明,激活引导的提取能够提高可迁移供体切片的质量,同时保持小比例融合的机制。这为跨规模模型融合提供了新的思路,尤其是在无需额外训练的情况下,为资源受限场景下的模型增强提供了可能。

尽管结果令人鼓舞,但研究者也指出,当前方法依赖于任务条件激活图,可能需要对每个任务进行适配。未来的工作可以探索更通用的激活引导策略,以及在不同模型家族上的适用性。

这项研究为模型融合领域带来了新的视角,证明了在无需语义对齐的情况下,跨规模知识迁移是可行的,且效果显著。随着进一步的研究,这种方法有望在模型压缩和高效部署中发挥重要作用。

延伸阅读

  1. 查询知道该遗忘什么:线性注意力中的第二擦除方向
  2. 对比学习赋能对撞机实验:可解释异常检测新框架ORCA
  3. 鲁棒双模型协作随机向量功能链接网络
查看原文