SheepNav
新上线今天0 投票

弱到强在线蒸馏:让弱小模型教会强大模型的新范式

弱到强在线蒸馏:让弱小模型教会强大模型的新范式

在大型语言模型(LLM)能力迁移领域,在线蒸馏(On-Policy Distillation, OPD) 一直被视为有效范式。它通过让学生模型在自己的生成序列上对齐教师模型的词元级分布,实现能力转移。然而,传统 OPD 方法存在一个隐含假设:教师模型必须至少与学生模型同等或更强。这导致两个困境:一是当学生模型已处于能力前沿、不存在更大教师时,蒸馏无法进行;二是若想通过合并多个领域专家来提升学生,则需在学生规模上进行昂贵训练。

近期,一篇来自微软研究团队的论文《Weak-to-Strong On-Policy Distillation》提出了一种颠覆性框架——弱到强在线蒸馏(W2S-OPD),首次证明多个弱模型可以共同教出一个更强的学生模型,且无需大规模额外训练。

核心方法:对比对构造代理教师

W2S-OPD 的关键在于构造一个“代理教师”。它并非真实存在的完整模型,而是在logit 空间中通过一对对比模型(正模型和负模型)的 logit 差构建而成。这对模型都比学生小,获取成本低。它们的 logit 差能够隔离出特定的能力方向(如推理技能、规模优势、实例级解题方向)。将这个方向向量加到学生自身的基础模型 logit 上,便得到一个既包含该能力方向、又在分布上与学生接近的代理教师。随后,学生通过最小化自身生成序列上的逐词元反向 KL 散度来蒸馏这一代理教师。

论文给出了三种对比对实例:

  • 后 RL 专家 vs. 前 RL 初始化:隔离强化学习注入的技能;
  • 大基础模型 vs. 小基础模型:隔离规模带来的能力;
  • 带正确提示的小模型 vs. 带错误提示的小模型:隔离实例级的解题方向。

实验结果:超越教师与持续进步

4 个数学基准3 个代码基准 上,W2S-OPD 全面优于传统 OPD。更令人惊讶的是,学生模型不仅能超越领域专家(如后 RL 教师),即使所有监督源都比学生弱,学生仍能持续提升。分析表明,不同对比对提供了不同的信号:后 RL 对比和提示对比侧重于推理框架,而规模对比则强调解题过程。

行业意义与未来展望

这项研究挑战了“强者为师”的固有认知,为 LLM 能力提升开辟了新路径。在模型规模竞赛日益激烈的当下,W2S-OPD 提供了一种低成本、可扩展的持续改进方案:无需等待更大模型出现,也无需重复大规模训练,只需利用已有的弱模型组合,即可推动前沿模型进一步进化。这或许意味着,未来 LLM 的进步不再单纯依赖算力堆砌,而是更依赖智能的蒸馏策略与对比学习设计

论文代码将在 GitHub 公开,值得关注。

延伸阅读

  1. 梯度与自然梯度之间:LoRA 初始化的连续统
  2. 动态参数化不等于动态推理:新研究揭示AI模型效率评估误区
  3. Shared SFT Lessons Across Alignment, Model Organisms, and Toy Models
查看原文