SheepNav
新上线今天0 投票

自定义奖励函数:让多轮强化学习真正学到东西——以Amazon Nova Forge为例

在多轮强化学习(RL)中,自定义奖励函数决定了模型真正学到的内容。一个细微的错误奖励可能在训练曲线看似健康的同时,悄悄教会模型错误的行为。设计一个在多轮、智能体任务中稳健的奖励函数,是定制Amazon Nova模型最困难的部分之一。

Amazon Nova Forge通过其自带编排(BYOO)能力,让你在自己的环境中运行奖励逻辑。你可以专注于定义什么是好的结果,而Nova Forge则协调 rollout、消息传递和跨轮对话状态。此外,Nova Forge还提供了无服务器多轮RL选项(现已全面可用),适合不想管理环境的团队。本文采用BYOO路径。

Amazon Nova提供多种定制方法,其中强化微调(RFT)尤为突出,因为它可以通过迭代反馈教会模型你想要的行为。与监督微调(SFT)不同,RFT不要求带有注释推理路径的精选示例,而是从模型自身输出的评估信号中学习。多轮RFT将其扩展到在一系列步骤中行动的智能体,例如调用工具、执行代码或从错误中恢复。它优化整个轨迹的累积奖励,而不是评估单个响应。

RFT的核心是奖励函数:指导模型的评分机制,也是你设计的部分。研究表明,RL在分布外(OOD)泛化方面优于SFT,但前提是奖励设计得当。

本文聚焦于奖励函数本身:如何设计一个复合多轮奖励,让组相对策略优化(GRPO)能够学习。文章还展示了如何在奖励中安全地执行模型生成的代码,以及为什么对每个组件进行监控,以便你信任训练所学。第一部分涵盖了Amazon SageMaker HyperPod和Nova Forge基础设施。最后,我们总结了可能悄悄破坏奖励的陷阱,这些陷阱来自一次真实运行,其中权重最高的组件默默贡献了零学习信号。

关键要点

  • 奖励设计是RFT的核心:奖励函数决定了模型的学习方向,必须精心设计。
  • BYOO提供灵活性:在自有环境运行奖励逻辑,便于集成现有代码和工具。
  • 安全执行模型代码:在奖励中执行模型生成的代码需谨慎,防止安全风险。
  • 监控每个组件:通过监控,确保每个奖励组件都提供有效的学习信号。

陷阱与建议

在一次真实训练中,权重最高的奖励组件没有提供任何学习信号,导致模型未按预期优化。因此,建议对每个奖励组件进行单独监控,并定期检查其分布,确保它们仍在提供有效反馈。此外,奖励设计应避免过度稀疏或过于复杂,以免训练不稳定。

结论

多轮强化学习的奖励函数设计需要深思熟虑,结合领域知识、安全考虑和持续监控。Amazon Nova Forge提供了强大的工具,但真正的挑战在于如何定义“好”的结果。通过本文的指导,你可以避免常见陷阱,让模型真正学到有价值的行为。

延伸阅读

  1. 怀疑法院使用AI,男子在诉讼文件中注入提示词试图赢得官司
  2. 视频星期五:起重时刻
  3. 马克·扎克伯格与“Instagzam”:Instagram新标志引发的思考
查看原文