Amazon EKS 上 MoE 强化学习扩展实践:借助 EFA 与 DeepEP 吞吐量提升 40%
当 MoE 遇上强化学习,基础设施面临三重考验
**混合专家模型(MoE)**已成为大语言模型扩展至千亿乃至万亿参数的主流架构,稀疏化设计让推理成本更可控。但当这类模型进入后训练阶段——尤其是 RLHF(基于人类反馈的强化学习)或 GRPO(组相对策略优化)——基础设施压力会陡然加剧。
AWS 团队在一篇技术博客中披露,他们通过组合 Amazon EKS、Elastic Fabric Adapter(EFA) 与 DeepEP,将大规模 MoE 强化学习的聚合 rollout 吞吐量提升了 40%。
为什么 MoE 的 RL 后训练这么难?
与稠密模型不同,MoE 后训练面临三个同时发生的挑战:
- 异构计算协调:rollout 生成(偏推理)与策略训练(偏训练)需要不同类型的资源,二者必须动态配合。
- 高吞吐通信:数百个加速器之间需要持续保持高带宽互联。
- 子系统动态编排:奖励模型、验证器、检查点更新等环节都会带来额外的内存、网络与编排压力。
文章特别指出,随着 MoE 架构越来越稀疏以降低推理成本,训练阶段的瓶颈正从计算转向通信。
专家并行(EP)是通信开销的关键来源
在张量并行(TP)、数据并行(DP)、流水线并行(PP)之外,MoE 额外引入了专家并行(Expert Parallelism,EP)。EP 需要在设备之间进行动态的 all-to-all token 路由,这比结构化通信模式更难优化。
在紧耦合的异步 RL 工作负载中,训练与推理必须保持平衡:训练步太慢会拖住推理 worker,推理吞吐不足又会让训练加速器闲置。
解决方案的核心组合
AWS 给出的架构方案整合了三个关键组件:
- Amazon EKS:提供弹性容器编排,支撑异构计算资源的动态调度。
- EFA:为数百个加速器提供低延迟、高带宽的网络通信能力。
- DeepEP:针对专家并行的通信优化库,缓解 all-to-all 路由带来的开销。
该架构还结合了 Amazon S3 用于数据与检查点管理。最终效果是:大规模 RLHF 与 GRPO 训练的聚合 rollout 吞吐量提升 40%。
这意味着什么?
对于正在尝试 MoE 后训练的团队来说,这项实践传递了一个明确信号:稀疏化带来的推理红利,需要配套的通信优化才能转化为训练效率。单纯堆叠加速器并不够,编排层、网络层与通信库的协同设计才是关键。
AWS 此次披露的架构并未给出具体集群规模或模型参数细节,但 40% 的吞吐提升对于 RLHF 这类计算密集且通信敏感的场景而言,是一个值得关注的工程参考。
