vLLM 借助 DSpark 在 4 台 GB300 跑出 Kimi K3 新高
vLLM 公布了 Kimi K3 模型的最新推理吞吐测试结果。在低熵推理负载下,系统借助 DSpark 优化,于 4 台 GB300 服务器(4×4 GPU 配置)上,将 batch size 设为 1 时的 decode 峰值速度大幅提升至 464 tok/s,展现了顶尖硬件结合软件优化的强劲性能。
2026-07-29 ~ 2026-07-29 · 2 条相关
- 第 1 集:vLLM 为 Moonshot Kimi K3 提供 Day-0 支持(2026-07-27,11 条)
- 第 2 集:Fireworks 平台上线 Kimi K3 推理与多维微调功能(2026-07-28,2 条)
- 第 3 集:Kimi K3 2.8T参数模型在80张RTX 5090上零HBM运行(2026-07-28,8 条)
- 第 4 集:Kimi K3 开放权重发布,引爆开源与基础设施讨论(2026-07-28,5 条)
- 第 5 集:算力账本:Kimi K3 自托管百天内回本(2026-07-28,4 条)
- 第 6 集:极客尝试在 Mac 设备本地量化运行 K3 大模型(2026-07-29,2 条)
- 第 7 集:Kimi K3 开源 2.8 万亿参数推高算力门槛(2026-07-29,3 条)
- 第 8 集:vLLM 借助 DSpark 在 4 台 GB300 跑出 Kimi K3 新高(2026-07-29,2 条)
- 第 9 集:Kimi K3开源首日获vLLM及AMD等多平台支持(2026-07-30,14 条)
- vLLM 在 Kimi-K3 上借助 DSpark 跑到 464 tok/s — vllm_project · 2026-07-29
- vLLM 公布 Kimi K3 在 4 台 GB300 上跑到 464 tok/s — zhyncs42 · 2026-07-29