vLLM 实现 Kimi K3 Day 0 支持,8 张 B300 即可跑起 2.8T MoE
vllm_project · x · 2026-07-30
vLLM 团队发文宣布,在 Moonshot AI 开源 Kimi K3 权重的首日,vLLM 即提供了高效的生产级推理支持。
架构与部署挑战
- 模型规模:Kimi K3 是 2.8 万亿参数的 MoE 模型(每个 token 激活 16 个专家),具备 100 万 token 上下文窗口和原生视觉能力。
- 核心架构:基于 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 构建。
- 工程难点:团队重点解决了 KDA、MXFP4 MoE、KV 缓存管理、prefill/decode 分离、推测解码以及长上下文部署的协同运行难题。
部署命令
最简部署仅需 8 张 NVIDIA B300 或 AMD MI355X GPU,通过添加特定参数即可启用 Inferact 开源的 DSpark 推测器以进一步提升推理速度。
所属事件:Kimi K3开源首日获vLLM及AMD等多平台支持(14 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23