SheepNav
新上线今天0 投票

ERR+:通过序列熵解析实现高效且果断的大语言模型推理

在人工智能领域,大型推理模型通过生成扩展的思维链(CoT)轨迹,在复杂任务上取得了显著成绩。这一过程通常依赖于带有可验证奖励的强化学习(RLVR)。然而,当前的RLVR方法虽然基于正确性奖励信号取得了不错的效果,但对推理过程本身的质量指导有限,导致内部推理结构未能充分优化。

最近,一项名为ERR+的研究提出了一种两阶段RLVR框架,旨在通过序列熵解析来提升推理效率与决策果断性。该研究在多个模型家族上进行实证分析,发现一个一致的模式:正确的推理轨迹在思考阶段表现出更频繁且更大的token级熵降。基于此,ERR+的第一阶段训练使用熵缓解奖励(ERR),该奖励与思考阶段累积的token级熵降成正比,并通过响应长度进行对数归一化。与以往抑制熵的方法不同,ERR奖励不确定性的解决,同时不约束探索性的高熵状态。第二阶段引入鲁棒相对效率奖励,通过tanh变换的组内z分数对每个响应的长度进行评分,与共同生成的同伴进行比较。

研究者还提供了形式化分析,表明两个目标的联合优化在训练早期会引发梯度冲突,因此设计了顺序执行方案。在五个数据集上的实验显示,ERR+在准确性和响应简洁性方面均取得了一致改进,适用于多种模型骨干。

这一研究的价值在于,它从信息论角度揭示了推理质量与熵变化的关系,为优化推理过程提供了新思路。通过奖励熵降而非单纯抑制熵,ERR+鼓励模型在保持探索性的同时,更高效地收敛到正确结论。此外,顺序训练策略有效避免了联合优化中的冲突,为RLVR框架的设计提供了参考。

尽管ERR+在多个数据集上表现优异,但其可扩展性和实际应用场景仍需进一步验证。未来,结合更多样化的任务和模型,ERR+有望在提升AI推理能力方面发挥更大作用。

延伸阅读

  1. 通用编码计算迎来学习理论新基础:应对分布式系统中的慢节点问题
  2. 语义ID推荐器的离线策略评估:模型自身的代码层级是否有帮助?
  3. Conservative Hybrid Graph Networks for Process Systems with Learned Routing
查看原文