vLLM 为 Moonshot 2.8 万亿参数 Kimi K3 上线 day-0 推理支持
vllm_project · x · 2026-07-28
vLLM 发布 Kimi K3 的 day-0 推理部署指南
vLLM 说自己已经对 Moonshot 的 Kimi K3 做到 day-0 支持,因为该模型权重已公开。帖子本身是一篇面向生产部署的实操指南,而不是单纯的模型宣传。
文中给出的关键信息包括:
- Kimi K3 是一个 2.8 万亿参数的 MoE 模型,每个 token 激活 896 个专家中的 16 个。
- 模型采用 Kimi Delta Attention(KDA) 和 Attention Residuals(AttnRes)。
- 支持 100 万 token 上下文,并且具备 原生视觉能力。
- 这篇指南重点讨论如何把 KDA、MXFP4 MoE 执行、KV cache 管理、prefill/decode 解耦、speculative decoding 和长上下文部署 组合到一个可实际运行的 serving engine 里。
配图里还展示了缓存结构、解码吞吐和不同残差方案的内存/性能权衡。
所属事件:vLLM 为 Moonshot Kimi K3 提供 Day-0 支持(11 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23