SheepNav
新上线今天0 投票

MeRLa:元学习奖励塑形,让RLHF更高效稳定

核心结论

强化学习从人类反馈(RLHF)是大语言模型对齐偏好的主流方法,但其质量受限于静态、任务无关的奖励模型。这种不匹配导致学习信号稀疏,对齐效果欠佳。最新研究提出 MeRLa(Meta-Learned Reward Shaping),一种通过元学习任务感知塑形函数的框架,在 RLHF 训练前从辅助任务中学习奖励塑形,从而生成复合奖励,既保持策略最优性,又提供任务特定的学习信号。在 LLaMA-3-8B 上的实验表明,MeRLa 在 AlpacaEval 2.0 上达到 90.8% 的长度控制胜率,MT-Bench 得分 9.14,且训练不稳定性降低 41%,全面超越 PPO、DPO、GRPO 和 DAPO。

方法亮点

MeRLa 的核心是学习一个塑形函数 Φ(x,y;φ),将其与原始奖励结合形成复合奖励。其元目标函数融合了任务区分、熵正则化和基于势能的守恒,确保收敛稳定。理论方面,论文提供了策略不变性的理论保证,分析了表征漂移敏感性,并正式解决了熵最大化带来的激励错位问题。

实验结果

在 LLaMA-3-8B 上,MeRLa 在四个基准测试中一致优于现有方法。除了上述主要指标,MeRLa 还能与基于过程或基于规则的增强奖励相结合,保持其优势。这表明元学习奖励塑形是一种通用且有效的 RLHF 增强手段。

行业意义

RLHF 是当前大模型对齐的核心技术,但奖励模型的设计一直是个难题。MeRLa 通过元学习自动生成任务感知的塑形函数,减少了人工设计奖励的负担,同时提升了训练稳定性和最终性能。这一工作为更高效、更可靠的模型对齐提供了新思路,有望推动 RLHF 在实际应用中的广泛部署。

延伸阅读

  1. 梯度与自然梯度之间:LoRA 初始化的连续统
  2. 弱到强在线蒸馏:让弱小模型教会强大模型的新范式
  3. 动态参数化不等于动态推理:新研究揭示AI模型效率评估误区
查看原文