vLLM 借助 DSpark 在 4 台 GB300 跑出 Kimi K3 新高

vLLM 公布了 Kimi K3 模型的最新推理吞吐测试结果。在低熵推理负载下,系统借助 DSpark 优化,于 4 台 GB300 服务器(4×4 GPU 配置)上,将 batch size 设为 1 时的 decode 峰值速度大幅提升至 464 tok/s,展现了顶尖硬件结合软件优化的强劲性能。

2026-07-29 ~ 2026-07-29 · 2 条相关