vLLM 发文详解 Kimi K3 day-0 支持与 2.8 万亿 MoE 部署
vllm_project · x · 2026-07-29
vLLM 团队和 Inferact 发布了一篇关于 Kimi K3 day-0 支持 的详细博客。
- 文中把 Kimi K3 介绍为一个 2.8T 参数的 MoE 模型,拥有 1M 上下文 和原生视觉能力。
- 重点讲的是 vLLM 如何把 KDA、MXFP4 MoE、KV cache 管理、prefill/decode 解耦和 speculative decoding 组合到一起。
- 博客给出了可直接运行的部署命令,并称最容易的部署方式是 8 张 NVIDIA B300 或 8 张 AMD MI355X。
- 同时,Inferact 还开源了适配 Kimi K3 的 DSpark speculator,并给出了完整配置示例。
所属事件:vLLM 为 Moonshot Kimi K3 提供 Day-0 支持(11 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 拆解大疆无人机后 Sarah Guo 断言:深圳的制造知识学不来只能重建 — bookwormengr · 2026-09-23
- Ben Lorica:Agent 让数据栈不再容忍旧数据,「相关」不够要「实时为真」 — bigdata · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23