vLLM 优化 Kimi K3 推理:吞吐提升 2.2–2.8 倍,延迟降逾半
woosuk_k · x · 2026-09-18
vLLM 团队联合 Red Hat、NVIDIA、华为与 Inferact 发布 Kimi K3 推理优化深度复盘:相比 v0.27.1,在 B300 节点 8K/1K 负载、TP8 下吞吐提升 2.2–2.8 倍,延迟降低 56%–60%,TTFT 降低 72%–85%(并发 1/4/16)。
优化覆盖四个方向:
- 自适应投机 token 预算:配合 DSpark 8 token 投机采样;
- KDA 内部前缀检查点与混合批次零拷贝,解决 KDA 循环状态处理瓶颈;
- MXFP4 专家内核延迟完成化,减少小张量拷贝;
- ReplaySSM、prefill/decode 分离、缓存卸载与 decode 上下文并行。
作者强调调度器限制和小张量拷贝的影响可与大 GEMM 相当。文末给出完整启动命令与复现步骤,优化工作在 issue #50587 中公开追踪。
所属事件:vLLM 深度优化 Kimi K3 推理,吞吐最高提升 2.8 倍(2 条相关)→
「Infra」频道最新
- 支付公司争抢推理入口:Stripe 携 OpenRouter、Ramp 切入推理链 — xkonjin · 2026-09-18
- Qdrant 四小时直播深挖向量搜索,回放已上线 — qdrant_engine · 2026-09-18
- 投资人:QNX 微内核是 Agent 时代被低估的边缘安全护城河 — pdamodaran · 2026-09-18
- Inception CEO Ermon:扩散模型将在文本推理效率上击败自回归 — No Priors · 2026-09-18
- 扩散模型先驱 Ermon:并行生成将颠覆自回归 LLM 推理 — No Priors · 2026-09-18
- Zalando 在 Kubernetes 上构建内部 Agent 平台的规模经验 — bibryam · 2026-09-18