vLLM 深度优化 Kimi K3 推理:吞吐提升 2.2–2.8 倍

vllm_project · x · 2026-09-17

vLLM 官方博客详解 Kimi K3 服务端优化:在 B300 节点、8K/1K 负载、TP8 配置下,相比 v0.27.1 实现吞吐 2.2–2.8 倍提升、延迟降低 56–60%、TTFT 降低 72–85%(并发 1/4/16 三档)。

关键改动覆盖全栈:

文章指出调度器限制、小张量拷贝等细节与大型 GEMM 同样影响性能,并给出可直接复现的服务启动命令与 benchmark。相关工作在 issue #50587 跟踪。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →