SheepNav
新上线今天0 投票

在AWS上部署Kimi K3:万亿参数开源模型的实践指南

2026年7月27日,Moonshot AI发布了Kimi K3,这是首个达到3万亿参数级别的开源MoE模型,拥有2.8万亿总参数896个专家模块(每token激活16个)。本文详细介绍了在AWS上部署Kimi K3的两种方案:Amazon SageMaker HyperPodAmazon Elastic Kubernetes Service (Amazon EKS)

Kimi K3的核心特性

Kimi K3采用了创新的架构,包括Kimi Delta Attention (KDA)Gated Multi Head Latent Attention (MLA)Stable LatentMoE框架。其关键参数如下:

属性
总参数 2.8万亿
每token活跃参数 1040亿
架构 MoE
专家数 896(每token激活16个)
上下文窗口 100万token
模态 原生多模态(文本+视觉)
发布日期 2026年7月27日

该模型在长周期编码、智能体工作流和复杂推理方面表现出色,支持原生工具调用、结构化输出和持续思考模式。

模型权重与格式

Kimi K3的开放权重以MXFP4(Microscaling Floating Point 4-bit)格式发布在Hugging Face上,标识为moonshotai/Kimi-K3。这种格式在模型质量和内存效率之间取得了平衡。由于模型规模庞大,部署需要vLLM day-0推理容器(当前为vllm/vllm-openai:kimi-k3),未来将合并到主vLLM容器中。

AWS部署方案

1. Amazon SageMaker HyperPod

SageMaker HyperPod提供托管基础设施,专为大规模分布式训练和推理设计。部署步骤包括:

  1. 创建HyperPod集群:配置GPU实例(如p5.48xlarge),确保足够显存。
  2. 加载模型权重:从Hugging Face下载MXFP4格式权重。
  3. 配置推理容器:使用vLLM容器启动服务。
  4. 设置自动缩放:根据负载动态调整资源。

2. Amazon EKS

对于熟悉Kubernetes的团队,EKS提供了更高的灵活性:

  1. 创建EKS集群:部署GPU节点组(如g5或p4d实例)。
  2. 部署vLLM推理服务:编写Kubernetes清单,使用vLLM镜像。
  3. 配置持久卷:存储模型权重。
  4. 暴露服务:通过LoadBalancer或Ingress对外提供API。

性能与优化

由于Kimi K3的活跃参数仅占总量约3.7%,推理时的计算效率较高。优化建议包括:

  • 使用FP4量化减少显存占用。
  • 启用连续批处理提高吞吐量。
  • 利用KV缓存加速长序列推理。

总结

Kimi K3的开源发布标志着开源模型在规模上迈入3万亿参数时代。AWS提供的SageMaker HyperPod和EKS两种方案,分别适合不同技术栈的团队。随着vLLM的正式支持,部署门槛将进一步降低,推动更多组织探索前沿AI能力。

延伸阅读

  1. 孤独AI穿戴设备Friend回归:新增语音功能,价格翻倍
  2. Chrome 或将支持免重启更新,速度大幅提升
  3. AI助力Chrome漏洞修复数量激增:Google称6月修复量超过过去两年总和
查看原文