vLLM 在 Kimi-K3 上借助 DSpark 跑到 464 tok/s
vllm_project · x · 2026-07-29
vLLM 公布了在 Kimi-K3 上的最新推理吞吐:在低熵推理负载下,batch size = 1 时达到 464 tok/s。
- 测试环境是 4× GB300,并使用公开镜像 vllm/vllm-openai:kimi-k3。
- 结果可复现,线程里给出了 Inferact 的 DSpark draft model。
- 这更像是 vLLM 推理/serving 栈与 speculative decoding 的性能结果,而不是单纯的模型发布。
所属事件:vLLM 借助 DSpark 在 4 台 GB300 跑出 Kimi K3 新高(2 条相关)→
「Infra」频道最新
- Kimi K3 常量状态设计让长上下文显存降约 73% — bookwormengr · 2026-07-29
- AI 资本仍在涌入,开源权重和推理更像小步机会 — vaibhavbetter · 2026-07-29
- vLLM 首场台湾 meetup 聚焦 GPU 优化与本地部署 — vllm_project · 2026-07-29
- 英国 315 个数据中心排队接电,拟先缴网费锁定 73GW 需求 — nordicinst · 2026-07-29
- PrunaAI 开源 LTX-2.3 视频解码器,显存减半还更快 — linoy_tsaban · 2026-07-29
- Google 首次出现季度自由现金流转负 — michalmalewicz · 2026-07-29