弱到强在线蒸馏:让弱小模型教会强大模型的新范式
弱到强在线蒸馏:让弱小模型教会强大模型的新范式
在大型语言模型(LLM)能力迁移领域,在线蒸馏(On-Policy Distillation, OPD) 一直被视为有效范式。它通过让学生模型在自己的生成序列上对齐教师模型的词元级分布,实现能力转移。然而,传统 OPD 方法存在一个隐含假设:教师模型必须至少与学生模型同等或更强。这导致两个困境:一是当学生模型已处于能力前沿、不存在更大教师时,蒸馏无法进行;二是若想通过合并多个领域专家来提升学生,则需在学生规模上进行昂贵训练。
近期,一篇来自微软研究团队的论文《Weak-to-Strong On-Policy Distillation》提出了一种颠覆性框架——弱到强在线蒸馏(W2S-OPD),首次证明多个弱模型可以共同教出一个更强的学生模型,且无需大规模额外训练。
核心方法:对比对构造代理教师
W2S-OPD 的关键在于构造一个“代理教师”。它并非真实存在的完整模型,而是在logit 空间中通过一对对比模型(正模型和负模型)的 logit 差构建而成。这对模型都比学生小,获取成本低。它们的 logit 差能够隔离出特定的能力方向(如推理技能、规模优势、实例级解题方向)。将这个方向向量加到学生自身的基础模型 logit 上,便得到一个既包含该能力方向、又在分布上与学生接近的代理教师。随后,学生通过最小化自身生成序列上的逐词元反向 KL 散度来蒸馏这一代理教师。
论文给出了三种对比对实例:
- 后 RL 专家 vs. 前 RL 初始化:隔离强化学习注入的技能;
- 大基础模型 vs. 小基础模型:隔离规模带来的能力;
- 带正确提示的小模型 vs. 带错误提示的小模型:隔离实例级的解题方向。
实验结果:超越教师与持续进步
在 4 个数学基准 和 3 个代码基准 上,W2S-OPD 全面优于传统 OPD。更令人惊讶的是,学生模型不仅能超越领域专家(如后 RL 教师),即使所有监督源都比学生弱,学生仍能持续提升。分析表明,不同对比对提供了不同的信号:后 RL 对比和提示对比侧重于推理框架,而规模对比则强调解题过程。
行业意义与未来展望
这项研究挑战了“强者为师”的固有认知,为 LLM 能力提升开辟了新路径。在模型规模竞赛日益激烈的当下,W2S-OPD 提供了一种低成本、可扩展的持续改进方案:无需等待更大模型出现,也无需重复大规模训练,只需利用已有的弱模型组合,即可推动前沿模型进一步进化。这或许意味着,未来 LLM 的进步不再单纯依赖算力堆砌,而是更依赖智能的蒸馏策略与对比学习设计。
论文代码将在 GitHub 公开,值得关注。