vLLM 公布 Kimi K3 在 4 台 GB300 上跑到 464 tok/s
zhyncs42 · x · 2026-07-29
- vLLM 公布了在 Kimi K3 上新的 bs=1 decode 峰值:464 tok/s。
- 该结果来自一个低熵推理负载,在 4×4 GB300 上运行 Kimi-K3 + DSpark。
- 团队表示这个 benchmark 可完全复现,公开镜像是 vllm/vllm-openai:kimi-k3,线程里还给出了 DSpark draft model。
- 配图里的博客截图强调这是面向生产部署的方案:vLLM 认为 Kimi K3 在单用户低延迟、并发效率和 agent 扩展性上都已准备好,并使用 TorchSpec 训练了 speculative decoder。
所属事件:vLLM 借助 DSpark 在 4 台 GB300 跑出 Kimi K3 新高(2 条相关)→
「编程与Agent」频道最新
- AI 编程代理正在消解开发者的心流状态 — bendee983 · 2026-07-29
- Kimi K3 登顶 Arena 全栈编程榜,力压 GPT-5.6 与 Claude — iamfakhrealam · 2026-07-29
- 华为 SearchArt 用验证合成任务训练 27B 长程搜索智能体 — _reachsumit · 2026-07-29
- Agent Retrieval Bench 评测编码智能体补丁前能否找对仓库文件 — _reachsumit · 2026-07-29
- TopoGR 用 Hamming 几何保住生成式推荐的语义 ID 拓扑 — _reachsumit · 2026-07-29
- Grevo 把语义 ID 分配改造成可进化变量 — _reachsumit · 2026-07-29