vLLM 借助 DSpark 在 4 台 GB300 跑出 Kimi K3 新高
vLLM 公布了 Kimi K3 模型的最新推理吞吐测试结果。在低熵推理负载下,系统借助 DSpark 优化,于 4 台 GB300 服务器(4×4 GPU 配置)上,将 batch size 设为 1 时的 decode 峰值速度大幅提升至 464 tok/s,展现了顶尖硬件结合软件优化的强劲性能。
2026-07-29 ~ 2026-07-29 · 2 条相关
- vLLM 在 Kimi-K3 上借助 DSpark 跑到 464 tok/s — vllm_project · 2026-07-29
- vLLM 公布 Kimi K3 在 4 台 GB300 上跑到 464 tok/s — zhyncs42 · 2026-07-29