vLLM and AMD Provide Day-0 Support for Kimi K3 Deployment
Moonshot AI 开源 Kimi K3 模型,vLLM 团队与 AMD 同步实现了 Day-0(首日)生产级推理支持。Kimi K3 是一个拥有 2.8 万亿参数的混合专家(MoE)模型,此次原生支持让开发者能迅速在多种硬件上完成开箱部署,显著降低了万亿参数级大模型的落地门槛。
已确认
- 模型架构:Kimi K3 总参数量达 2.8 万亿,采用混合专家(MoE)架构,每个 Token 激活 16 个专家。模型支持 100 万 Token 的超长上下文窗口,并具备原生视觉能力。
- 硬件部署:vLLM 团队确认,跑起该 2.8T 参数的 MoE 模型最低只需 8 张 B300 显卡。
- AMD 生态支持:vLLM 项目宣布原生支持 AMD ROCm 生态,完整的 2.8T 模型可直接在 AMD Instinct 系列硬件上部署。AMD 高管 Anush Elangovan 确认了通过双方合作,成功在 Day 0 支持了 Kimi K3 以及 MI355X 等硬件,并强调“速度就是护城河”。
为什么重要
- 降低部署门槛:2.8 万亿参数的模型对显存和算力要求极高,vLLM 提供的高效推理支持使得仅需 8 张 B300 即可运行,极大降低了超大规模开源模型的实验与生产成本。
- 打破硬件垄断:首日即原生支持 AMD ROCm 生态与 Instinct 硬件,为开发者提供了 NVIDIA 之外的强力替代方案,有助于加速 AI 推理硬件生态的多元化竞争。
2026-07-30 ~ 2026-07-30 · 5 related posts
Primary sources
- [source] Kimi K3 runs on vLLM + AMD from Day 0, supporting 2.8T params on Instinct — vllm_project · 2026-07-30
- vLLM Announces Day-0 Support for Kimi K3: Deploying the 2.8T Parameter Model — vllm_project · 2026-07-30
- AMD MI355X Achieves Day 0 Support for Kimi K3, Boosting AI Ecosystem — AnushElangovan · 2026-07-30
2 near-duplicate retellings: vllm_project · vllm_project