循环语言模型的自改进新范式:LoopOPD 用自身循环计算当老师
当模型学会「自己教自己」
循环语言模型(Looped Language Models, LoopLMs)的思路颇具吸引力:不靠堆参数,而是让同一套参数在多个循环计算步骤中被反复复用,用「算得更久」来换取更强的推理能力。这是一种参数效率极高的扩展路径。
但问题也随之而来——这类模型的后训练(post-training)一直不好做。现有方案大致两条路:要么用奖励信号做监督,但信号稀疏,且要扩展到多个循环层代价高昂;要么依赖外部教师模型或特权信息,可教师资源有限,还容易出现「师生上下文不匹配」的尴尬。
来自 arXiv 的这篇论文(arXiv:2610.10623,提交于 2026 年 10 月 7 日)提出了一个颇具巧思的解法:让模型自己的循环计算充当监督来源。
LoopOPD:把「最后一圈」变成老师
论文提出的 LoopOPD 是一个跨循环的在线策略蒸馏框架(cross-loop on-policy distillation)。核心机制可以这样理解:
- 把一个冻结的终端循环策略当作「计算特权教师」,它的优势在于拥有更多的循环计算量;
- 让一个**中间循环的「学生」**在自身生成的 rollout 上接受蒸馏监督;
- 这样就获得了密集的监督信号,而且既不需要外部教师,也不需要特权信息。
这相当于把「多想几轮」的能力,蒸馏回「少想几轮」的层级——监督信号来自模型内部的计算深度差异,而非外部标注。
D-LoopOPD:让老师也跟着进化
静态的教师总有天花板。作者进一步提出 Dynamic LoopOPD(D-LoopOPD):随着共享模型参数不断更新,终端循环教师也会被持续刷新。这样一来,模型就进入了循环式自我改进的状态——学生进步,老师同步升级,再教出更强的学生。
论文还刻画了蒸馏更新如何在不同循环深度之间传播,并推导出「单次更新即可在两个循环深度上同时实现局部改进」的充分条件。这部分理论分析,为方法的有效性提供了机制层面的解释。
实验结果与意义
在 Ouro-Thinking 模型上的实验显示:
- LoopOPD 提升了数学推理能力;
- D-LoopOPD 通过动态教师更新带来进一步增益;
- 值得注意的是,模型仅在数学数据上训练,却在通用推理和代码生成基准上也取得了提升——说明这种循环计算监督具有跨任务的迁移性。
论文共 28 页、8 张图,已投稿至 ICLR 2027,代码与模型检查点将在接收后放出。
为什么值得关注
这项工作的价值在于,它把「计算量」本身变成了一种可蒸馏的监督资源。在外部教师昂贵、奖励信号稀疏的现实约束下,让模型用更深的自循环去指导更浅的自循环,为 LoopLM 的后训练打开了一条不依赖外部资源的新路。对于追求参数效率与推理能力平衡的研究方向而言,这或许是一个值得跟进的技术信号。
