无需训练的知识迁移:激活引导剪枝实现跨规模模型融合
在AI领域,模型规模的差异往往成为知识迁移的障碍。通常,将大型模型的能力迁移到小型模型需要复杂的对齐或训练过程。然而,一项新研究提出了一种无需训练的跨规模融合方法,通过激活引导的剪枝技术,在保持性能的同时实现知识的高效转移。
创新方法:Activation-Prune-Merge (APM)
来自研究者的一项新工作提出了 Activation-Prune-Merge (APM) 框架,旨在解决异构模型融合中的跨规模问题。传统方法通常需要神经元级别的语义对齐,而APM则另辟蹊径。它通过构建任务条件下的激活图,识别大型模型(供体)中与任务相关的关键部分,然后进行剪枝以匹配小型模型(受体)的架构。具体来说,APM会剪枝供体的层、隐藏维度、注意力头和MLP神经元,使其与受体的结构对齐,最后通过微小的插值系数将剪枝后的供体部分注入受体。
这种方法的核心思想是,将供体视为功能组件的集中来源,而非要求精确的结构移植。这种设计使得跨规模融合无需显式的语义对齐,就能实现知识转移。
显著性能提升
研究者在16个基准测试上进行了评估,涵盖推理、数学、代码生成、指令遵循和分类等任务。结果显示,APM将3B规模受体的平均准确率从 55.5% 提升至 60.6%。在具体任务上,RTE准确率从64.3%大幅提升至82.3%,QNLI从52.3%提升至65.7%,BoolQ从70.8%提升至79.2%。这些数据表明,激活引导的剪枝能够有效提取供体中的可迁移能力。
分析与未来方向
研究还分析了注入比例的影响,并探索了多阶段顺序融合的可能性。结果表明,激活引导的提取能够提高可迁移供体切片的质量,同时保持小比例融合的机制。这为跨规模模型融合提供了新的思路,尤其是在无需额外训练的情况下,为资源受限场景下的模型增强提供了可能。
尽管结果令人鼓舞,但研究者也指出,当前方法依赖于任务条件激活图,可能需要对每个任务进行适配。未来的工作可以探索更通用的激活引导策略,以及在不同模型家族上的适用性。
这项研究为模型融合领域带来了新的视角,证明了在无需语义对齐的情况下,跨规模知识迁移是可行的,且效果显著。随着进一步的研究,这种方法有望在模型压缩和高效部署中发挥重要作用。