vLLM 为 Moonshot Kimi K3 提供 Day-0 支持
vLLM 表示,Moonshot AI 的 Kimi K3 在权重公开后即可在其栈上实现 day-0 推理部署,并已发布面向生产环境的部署指南与技术详解。此次重点不只是 K3 具备 2.8 万亿参数、100 万 token 上下文和原生视觉能力,更在于 vLLM 给出了针对超大 MoE 的服务化方案:其认为真正难点是缓存而非参数量,并通过推测解码把单流吞吐提升到 370 tok/s。对行业而言,这展示了开源推理栈如何快速适配架构特殊的超大模型。
已确认
- vLLM 将 Kimi K3 描述为 2.8T 参数的 MoE 模型,每个 token 激活 16/896 个专家,支持 1M 上下文窗口,具备原生视觉能力,并采用 Kimi Delta Attention(KDA)架构。
- vLLM 认为,部署 K3 时最棘手的并不是 2.8T 参数本身,而是如何高效缓存。其解释称,K3 的许多层使用固定大小的 KDA state,而不是会随 token 增长的 KV cache,因此不需要处理传统按 token 递增的 KV 哈希增长问题,缓存压力更小。
- 为了在超大参数规模下兼顾低延迟与精度,Inferact 为 Kimi K3 训练并开源了 Kimi-K3-DSpark 草稿模型。vLLM 称该模型是面向 vLLM 的 MLA-native 方案,训练数据复用了 vLLM 自身抽取的 target hidden states,从而实现缓存复用;结合推测解码后,单流吞吐达到 370 tok/s。
- vLLM 还列出了 K3 当前可用的服务能力,包括 P/D disaggregation、prefix caching、KV offload,以及按拓扑选择的 MoE backend,例如 EP 场景使用 megamoe、TP>1 场景使用 trtllm。
为什么重要
对 2.8T 级别的 MoE 来说,能否稳定、低延迟地在线服务,关键往往在系统工程而非纸面参数规模。vLLM 这次公开的 KDA state 缓存思路,以及通过复用隐藏状态训练草稿模型的做法,为后续超大 MoE 的开源部署提供了可参考的工程路径。
2026-07-27 ~ 2026-07-29 · 11 条相关
- 第 1 集:vLLM 为 Moonshot Kimi K3 提供 Day-0 支持(2026-07-27,11 条)
- 第 2 集:Fireworks 平台上线 Kimi K3 推理与多维微调功能(2026-07-28,2 条)
- 第 3 集:Kimi K3 2.8T参数模型在80张RTX 5090上零HBM运行(2026-07-28,8 条)
- 第 4 集:Kimi K3 开放权重发布,引爆开源与基础设施讨论(2026-07-28,5 条)
- 第 5 集:算力账本:Kimi K3 自托管百天内回本(2026-07-28,4 条)
- 第 6 集:极客尝试在 Mac 设备本地量化运行 K3 大模型(2026-07-29,2 条)
- 第 7 集:Kimi K3 开源 2.8 万亿参数推高算力门槛(2026-07-29,3 条)
- 第 8 集:vLLM 借助 DSpark 在 4 台 GB300 跑出 Kimi K3 新高(2026-07-29,2 条)
- 第 9 集:Kimi K3开源首日获vLLM及AMD等多平台支持(2026-07-30,14 条)
一手来源
- vLLM 发文详解 Kimi K3 day-0 支持与 2.8 万亿 MoE 部署 — vllm_project ·
- 开源 Kimi K3 speculator 让单流吞吐升至 370 tok/s — vllm_project ·
- Kimi K3 用固定 KDA 状态替代增长式 KV 缓存 — vllm_project ·
- vLLM:K3 的 2.8T 参数不难,难的是缓存 — vllm_project · 2026-07-27
- vLLM 同步支持 Kimi K3:2.8 万亿参数、100 万上下文 — AAAzzam · 2026-07-27
- 【源头】Kimi K3 用固定 KDA 状态替代增长式 KV 缓存 — vllm_project · 2026-07-27
- vLLM 列出 Kimi K3 的解耦、KV offload 和 MoE 方案 — vllm_project · 2026-07-27
- Inferact 的 Kimi-K3-DSpark 复用 MLA 缓存加速 vLLM — vllm_project · 2026-07-27
- 【源头】开源 Kimi K3 speculator 让单流吞吐升至 370 tok/s — vllm_project · 2026-07-27
- Kimi K3 在 vLLM 上线,2.8T 参数开源模型支持 1M 上下文 — ricklamers · 2026-07-27
- vLLM 为 Moonshot 2.8 万亿参数 Kimi K3 上线 day-0 推理支持 — vllm_project · 2026-07-28
- vLLM 推出 Kimi K3 部署指南,适配 2.8T MoE 和百万上下文 — AccBalanced · 2026-07-28
- 【源头】vLLM 发文详解 Kimi K3 day-0 支持与 2.8 万亿 MoE 部署 — vllm_project · 2026-07-29
另有 1 条近重复转述:woosuk_k