vLLM 优化 Kimi K3 推理:吞吐提升 2.2–2.8 倍,延迟降逾半

woosuk_k · x · 2026-09-18

vLLM 团队联合 Red Hat、NVIDIA、华为与 Inferact 发布 Kimi K3 推理优化深度复盘:相比 v0.27.1,在 B300 节点 8K/1K 负载、TP8 下吞吐提升 2.2–2.8 倍,延迟降低 56%–60%,TTFT 降低 72%–85%(并发 1/4/16)。

优化覆盖四个方向:

作者强调调度器限制和小张量拷贝的影响可与大 GEMM 相当。文末给出完整启动命令与复现步骤,优化工作在 issue #50587 中公开追踪。

所属事件:vLLM 深度优化 Kimi K3 推理,吞吐最高提升 2.8 倍(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →