vLLM 在 Kimi-K3 上借助 DSpark 跑到 464 tok/s
vllm_project · x · 2026-07-29
vLLM 公布了在 Kimi-K3 上的最新推理吞吐:在低熵推理负载下,batch size = 1 时达到 464 tok/s。
- 测试环境是 4× GB300,并使用公开镜像 vllm/vllm-openai:kimi-k3。
- 结果可复现,线程里给出了 Inferact 的 DSpark draft model。
- 这更像是 vLLM 推理/serving 栈与 speculative decoding 的性能结果,而不是单纯的模型发布。
所属事件:vLLM 借助 DSpark 在 4 台 GB300 跑出 Kimi K3 新高(2 条相关)→
「Infra」频道最新
- Unsloth Desktop 热修复:Qwen-Image-2.1 支持图像编辑与量化修复 — danielhanchen · 2026-09-23
- 128GB Strix Halo 跑 Qwen3.6 35B-A3B 稳定 50 tok/s,用户问现在最优解是什么 — jankeydankey · 2026-09-23
- Together AI 上线灰度发布:模型升级不停机,分步切流自动回滚 — togethercompute · 2026-09-23
- 专为大规模运行 Agent 的专用硬件亮相 — cyrilzakka · 2026-09-23
- 三元权重压缩 27B 模型仅 5.9GB,推理能力保留 95% — cephaloform · 2026-09-23
- RTX5090 上 Qwen 27B 跑 24 小时,自主写出完整 Postgres-SpringBoot-React 表格应用 — anglepoiselife · 2026-09-23