vLLM 深度优化 Kimi K3 推理,吞吐最高提升 2.8 倍

vLLM 团队联合 Red Hat、NVIDIA、华为与 Inferact 发布 Kimi K3 推理优化深度复盘。在 B300 节点、8K/1K 负载、TP8 配置下,相比 v0.27.1 版本,服务端吞吐提升 2.2 至 2.8 倍,延迟降低超过一半(56%-60%)。官方博客详细介绍了此次优化的技术细节与实测数据。

2026-09-17 ~ 2026-09-18 · 2 条相关

另有 1 条近重复转述:woosuk_k