开源 Kimi K3 speculator 让单流吞吐升至 370 tok/s
vllm_project · x · 2026-07-27
- vLLM 这条回复强调:在 2.8T 参数模型上要做超低延迟且不掉精度,speculative decoding 是自然选择。
- @inferact 为 Kimi K3 训练并开源了一个 DSpark speculator,能在单次并行前向里一次草拟多个 token。
- 在真实推理任务数据集上,单流吞吐从 118 tok/s 提升到 370 tok/s,约 3.14×。
「Infra」频道最新
- Claude 对话被索引后,机密计算方案被再次推上台面 — bittingthembits · 2026-07-27
- Moonshot 开源 MoonEP,开闭源之争再被点燃 — KyeGomezB · 2026-07-27
- Kimi K3 的 2.5 倍 scaling-law 提升引发效率讨论 — andrew_n_carr · 2026-07-27
- Kimi K3 登陆 Nebius:100 万上下文、AA 57 分 — teortaxesTex · 2026-07-27
- AI agent 发现 Bun 的 `child_process.spawn` 兼容性旧 bug — steipete · 2026-07-27
- llama.cpp 在 PR 25994 中加入 Nanbeige4.2 支持 — pmttyji · 2026-07-27