vLLM 公布 Kimi K3 在 4 台 GB300 上跑到 464 tok/s
zhyncs42 · x · 2026-07-29
- vLLM 公布了在 Kimi K3 上新的 bs=1 decode 峰值:464 tok/s。
- 该结果来自一个低熵推理负载,在 4×4 GB300 上运行 Kimi-K3 + DSpark。
- 团队表示这个 benchmark 可完全复现,公开镜像是 vllm/vllm-openai:kimi-k3,线程里还给出了 DSpark draft model。
- 配图里的博客截图强调这是面向生产部署的方案:vLLM 认为 Kimi K3 在单用户低延迟、并发效率和 agent 扩展性上都已准备好,并使用 TorchSpec 训练了 speculative decoder。
所属事件:vLLM 借助 DSpark 在 4 台 GB300 跑出 Kimi K3 新高(2 条相关)→
「编程与Agent」频道最新
- 开发者分享笔记法:每日一条当收件箱,先采集后整理 — dSebastien · 2026-09-23
- 免费开源思路:为多 agent 项目省 token 的极简任务管理器 — Mysterious_Spell9300 · 2026-09-23
- 老开发者称 GPT-6 Astra 首次让他完全放心把编码交给模型 — josh_bickett · 2026-09-23
- 开发者自建本地 MCP,让 Grok「幕僚长」直接调度 Codex 任务 — Heavydone · 2026-09-23
- 让 LLM 加付费墙?记得告诉它墙后挡什么,否则全功能照常免费 — jdluk87 · 2026-09-23
- 7×24 全天候受治理 agent 团队,能拿来做什么生意? — DexTheConcept · 2026-09-23