#AI
AWS 发布 Kimi K3 部署指南,支持 2.8 万亿参数自托管
Kimi K3 是月之暗面 7 月 27 日发布的开源 MoE 模型,总参数量 2.8 万亿,896 个专家中每次激活 16 个,单次推理实际激活约 1040 亿参数,上下文窗口 100 万 token,支持文本和视觉输入。这是首个突破 3 万亿参数级别的开源权重模型。
AWS 官方博客给出两种部署方案:SageMaker HyperPod 路径通过 Inference Operator 自动化编排,配置 YAML 后推理端点自动拉起;Amazon EKS 路径面向希望自行管理 K8s 的团队,通过 EC2 Capacity Blocks 预留 p6-b300 实例。
💡 为什么值得看全球最大开源模型有了明确的云部署路径,对想自己跑同级别模型的企业是直接参考。
Kimi K3 内核参数
- **总参数量**:2.8 万亿(MoE 架构)
- **激活参数**:约 1040 亿/次(16/896 专家激活)
- **上下文窗口**:100 万 token
- **模态**:文本 + 视觉
- **注意力机制**:Kimi Delta Attention + Gated Multi Head Latent Attention
- **MoE 框架**:Stable LatentMoE
- **权重格式**:MXFP4(HuggingFace: moonshotai/Kimi-K3)
- **推荐推理引擎**:vLLM(专用镜像 vllm/vllm-openai:kimi-k3)
查证
来源档案
AWS 官方机器学习博客
亚马逊云服务官方发布的技术部署指南,附带完整 YAML 配置和调用示例。
一手官方源,部署步骤和配置参数可直接复现;模型规格引用月之暗面公开发布信息,数据可信。
延伸阅读
包含两套方案的完整 kubectl 命令和 Python/curl 调用示例,工程师可直接参考。