SheepNav
新上线昨天0 投票

在 AWS 上部署 Kimi K3:SageMaker HyperPod 与 EKS 双路径实践

随着开源权重模型在复杂任务中的表现日益强大,如何高效部署这些动辄数万亿参数的大模型成为企业关注的焦点。Moonshot AI 于 2026 年 7 月 27 日发布的 Kimi K3,作为首个达到 3 万亿参数级别的开源权重模型,凭借其创新的架构和卓越的性能,为自托管大模型树立了新标杆。本文基于 AWS 官方博客,详细介绍如何在 Amazon SageMaker HyperPod 和 Amazon EKS 上部署 Kimi K3,涵盖模型特性、部署步骤及关键技术要点。

Kimi K3 模型概览

Kimi K3 拥有 2.8 万亿参数,采用 Mixture of Experts(MoE)架构,包含 896 个专家,每次推理仅激活其中 16 个,因此每次前向传播仅需计算约 1040 亿参数,相比前代 Kimi K2,扩展效率提升了 2.5 倍。该模型支持 100 万 token 的上下文窗口,并原生支持文本与视觉的多模态输入。其独特的设计包括 Kimi Delta Attention(KDA)、Gated Multi Head Latent Attention(MLA)以及 Stable LatentMoE 框架,使其在长时程编码、智能体工作流和复杂推理任务中表现出色。

模型获取与格式

Kimi K3 的开源权重已在 Hugging Face 上发布,模型标识为 moonshotai/Kimi-K3,采用 MXFP4(Microscaling Floating Point 4-bit) 格式,在模型质量与内存效率之间取得了良好平衡。由于模型体量庞大,服务 Kimi K3 需要专用的 vLLM 推理容器,目前相关提交位于 vllm/vllm-openai:kimi-k3,预计未来将合并至主 vLLM 容器。

部署方案一:Amazon SageMaker HyperPod

SageMaker HyperPod 为大规模分布式训练和推理提供了托管基础设施,简化了集群管理。在 HyperPod 上部署 Kimi K3 的典型步骤包括:

  1. 创建 HyperPod 集群:选择合适的实例类型(如 p5.48xlarge,配备 8 张 H100 GPU),并配置必要的存储和网络。
  2. 构建自定义容器:基于 vLLM 的 Kimi K3 分支构建推理镜像,并推送至 Amazon ECR。
  3. 配置推理端点:通过 SageMaker SDK 或 CLI 创建端点,指定实例数量和容器参数。
  4. 测试与监控:使用示例请求验证模型输出,并利用 CloudWatch 监控资源利用率。

部署方案二:Amazon EKS

对于已有 Kubernetes 经验的企业,EKS 提供了更灵活的部署方式。核心步骤包括:

  1. 创建 EKS 集群:使用 eksctl 或 AWS 控制台创建集群,并配置节点组,建议使用 GPU 实例类型。
  2. 部署 NVIDIA 设备插件:确保 Pod 能够访问 GPU 资源。
  3. 部署 vLLM 推理服务:编写 Kubernetes Deployment 和 Service 清单,指定镜像和资源请求。
  4. 配置自动伸缩:利用 HPA(Horizontal Pod Autoscaler)或 KEDA 根据负载调整副本数。

总结与展望

在 AWS 上部署 Kimi K3 无论是通过 SageMaker HyperPod 还是 EKS,都为企业提供了灵活的选择。HyperPod 适合希望减少运维负担的团队,而 EKS 则适合已有 Kubernetes 基础设施的组织。随着 Moonshot AI 和 AWS 的持续合作,未来大模型部署的效率和易用性将进一步提升。

延伸阅读

  1. Reddit 与 Perplexity AI 的 DMCA 之争:搜索结果的版权边界何在?
  2. Claude发布恶意代码至互联网并攻击三家真实公司
  3. 谷歌地球撤回AI生成卫星图像工具:虚假图片风险引发行业反思
查看原文