在 Amazon SageMaker HyperPod 上用 SkyRL 加速多模态强化学习训练
多模态强化学习训练的新基建
强化学习(RL)后训练正逐渐成为构建强能力语言模型智能体的标准环节。模型通过生成轨迹、接收奖励并依据结果更新策略,从而学会在多步序列中进行推理与行动。但当这种训练扩展到多节点、单次运行消耗数百 GPU 小时的规模时,持久化的集群基础设施就成了刚需——它必须能扛住长时间任务、在硬件故障时保住进度,并让训练动态全程可见。
Amazon SageMaker HyperPod 正是为此类大规模机器学习负载而生,运行在 Amazon EKS 之上。它的集群韧性特性会持续监控节点健康并自动替换故障节点,配合检查点机制,训练任务可以从上次保存的步骤恢复,而不是从头再来。对于动辄数小时的多节点 RL 运行来说,这一点尤为关键。
SkyRL + Qwen3-VL-8B:一个可复现的实战路径
AWS 最新发布的技术博文展示了如何在这套基础设施上运行开源 RL 框架 SkyRL,对一个 Qwen3-VL-8B 视觉语言模型进行后训练,任务是让模型学会走视觉迷宫,采用的算法是 GRPO(Group Relative Policy Optimization)。
整个流程覆盖了从构建容器镜像、在 SageMaker Studio 中启动 Ray 集群,到提交与监控任务,再到托管训练好的 LoRA 适配器用于推理的完整链路。
结果颇具说服力:从 VisGym SFT 检查点出发,经过 HyperPod 上的 GRPO 后训练,模型在固定的 64 个迷宫评测集上的解题率从 43.75% 提升到 95% 以上。
关键能力拆解
- 集群韧性:自动节点替换 + 检查点,避免长时间 RL 运行因单点硬件故障而损失数小时进度。
- Ray on HyperPod:可从 SageMaker Studio 创建 Ray 集群,通过安全连接远程提交任务。
- 可观测性:HyperPod Observability EKS 插件预置了 Amazon Managed Grafana 仪表盘,训练动态一目了然。
前置条件速览
要复刻这一流程,需要:
- 一个由 Amazon EKS 编排的 SageMaker HyperPod 集群,至少包含 3 台 ml.g7e.12xlarge 和 1 台 ml.r5d.16xlarge 实例。
- 集群中安装 KubeRay operator、HyperPod Observability EKS 插件和 HyperPod Ray Endpoint Operator(用于远程任务提交)。
- 安装 Amazon FSx for Lustre CSI 驱动,并准备一个 FSx for Lustre 文件系统及对应的 PersistentVolume。
为什么值得关注
多模态 RL 后训练长期以来受制于工程复杂度:分布式 rollout、奖励计算、策略更新之间的协调,加上硬件故障带来的不确定性,让很多团队望而却步。HyperPod 把集群韧性、Ray 编排和可观测性打包成托管能力,SkyRL 则提供了开源的算法实现,二者的结合降低了从实验到规模化训练的门槛。
对于正在探索视觉语言模型智能体、或需要稳定跑长周期 RL 任务的团队来说,这条技术路径提供了一个值得参考的落地范式。
