在AWS上部署Kimi K3:万亿参数开源模型的实践指南
2026年7月27日,Moonshot AI发布了Kimi K3,这是首个达到3万亿参数级别的开源MoE模型,拥有2.8万亿总参数和896个专家模块(每token激活16个)。本文详细介绍了在AWS上部署Kimi K3的两种方案:Amazon SageMaker HyperPod和Amazon Elastic Kubernetes Service (Amazon EKS)。
Kimi K3的核心特性
Kimi K3采用了创新的架构,包括Kimi Delta Attention (KDA)、Gated Multi Head Latent Attention (MLA)和Stable LatentMoE框架。其关键参数如下:
| 属性 | 值 |
|---|---|
| 总参数 | 2.8万亿 |
| 每token活跃参数 | 1040亿 |
| 架构 | MoE |
| 专家数 | 896(每token激活16个) |
| 上下文窗口 | 100万token |
| 模态 | 原生多模态(文本+视觉) |
| 发布日期 | 2026年7月27日 |
该模型在长周期编码、智能体工作流和复杂推理方面表现出色,支持原生工具调用、结构化输出和持续思考模式。
模型权重与格式
Kimi K3的开放权重以MXFP4(Microscaling Floating Point 4-bit)格式发布在Hugging Face上,标识为moonshotai/Kimi-K3。这种格式在模型质量和内存效率之间取得了平衡。由于模型规模庞大,部署需要vLLM day-0推理容器(当前为vllm/vllm-openai:kimi-k3),未来将合并到主vLLM容器中。
AWS部署方案
1. Amazon SageMaker HyperPod
SageMaker HyperPod提供托管基础设施,专为大规模分布式训练和推理设计。部署步骤包括:
- 创建HyperPod集群:配置GPU实例(如p5.48xlarge),确保足够显存。
- 加载模型权重:从Hugging Face下载MXFP4格式权重。
- 配置推理容器:使用vLLM容器启动服务。
- 设置自动缩放:根据负载动态调整资源。
2. Amazon EKS
对于熟悉Kubernetes的团队,EKS提供了更高的灵活性:
- 创建EKS集群:部署GPU节点组(如g5或p4d实例)。
- 部署vLLM推理服务:编写Kubernetes清单,使用vLLM镜像。
- 配置持久卷:存储模型权重。
- 暴露服务:通过LoadBalancer或Ingress对外提供API。
性能与优化
由于Kimi K3的活跃参数仅占总量约3.7%,推理时的计算效率较高。优化建议包括:
- 使用FP4量化减少显存占用。
- 启用连续批处理提高吞吐量。
- 利用KV缓存加速长序列推理。
总结
Kimi K3的开源发布标志着开源模型在规模上迈入3万亿参数时代。AWS提供的SageMaker HyperPod和EKS两种方案,分别适合不同技术栈的团队。随着vLLM的正式支持,部署门槛将进一步降低,推动更多组织探索前沿AI能力。
