新上线今天0 投票
Amazon SageMaker HyperPod 与 Qumulo 联手实现跨区域训练,远程集群吞吐量媲美本地
在 AI 模型规模持续膨胀的当下,GPU 算力与训练数据往往分布在不同的 AWS 区域,跨区读取带来的延迟和成本让团队陷入两难:要么复制 PB 级数据,要么忍受训练变慢。Amazon SageMaker HyperPod 与 Qumulo 的联合方案给出了新答案。
架构与验证
该方案将 SageMaker HyperPod 与 Cloud Native Qumulo (CNQ) 及 Qumulo Cloud Data Fabric (CDF) 结合,允许训练任务直接读取位于其他 AWS 区域或本地的数据集,无需复制数据或修改代码。
为了验证效果,团队在 US East (Ohio) 区域部署了与数据同地的 hub 集群,在 US West (Oregon) 区域部署了通过 CDF 远程读取数据的 spoke 集群,网络延迟约 60 毫秒。两者运行相同的训练任务,对比吞吐量。
关键结果
- 单区域性能:CNQ 的云原生架构使其性能可独立于存储容量扩展,实现 99% GPU 利用率、p5.48xlarge 网络饱和以及 亚 3 毫秒的数据操作延迟。
- 远程集群表现:跨区域集群在短暂预热后,吞吐量达到与同地集群相同的水平(115–117 样本/秒),无需额外数据编排。吞吐量在 100–150 个批次内收敛,预热时间占比极小——在 10,000+ 批次时低于 1%,在 100,000+ 批次时低于 0.1%。初始阶段 GPU 利用率为 80–90%,随后稳定在 98–100%。
行业意义
这一方案解决了 AI 训练中数据本地性的核心痛点。以往,团队要么将数据复制到算力所在区域,消耗大量存储和传输成本;要么忍受跨区延迟,拖慢训练速度。SageMaker HyperPod 与 Qumulo 的组合让算力与数据解耦,同时保持高性能,为分布式 AI 训练提供了更灵活的架构选择。尤其对于需要频繁更新前沿模型、且数据分散在多地的大型团队,这意味著无需移动数据即可保持模型时效性,有望降低总体拥有成本并加速迭代。
