vLLM 为 2.8T 参数 Kimi K3 训练 DSpark,推理提速至 435 tok/s
AccBalanced · x · 2026-09-18
vLLM 团队发文介绍如何为月之暗面 2.8T 参数的 Kimi K3 训练 DSpark 投机解码器(基于 DeepSeek 的 DFlash 块级投机算法扩展),并开源。
核心结果:
- 数学推理单流交互性从 110 提升到 435 tokens/s/用户;
- 并发负载下,在同等交互性时输出吞吐最高提升 3.5 倍;
- 起草模型为 5B,每步提出 8 个 token,数学任务上平均每轮接受 6.4 个。
训练难点与做法:为如此大的模型训练 drafter 需要多节点——用 Speculators 训练库加上新的 Mooncake connector,通过 RDMA 在 vLLM 推理与训练之间流式传输 hidden states;用两台 GB300 NVL72 节点跑目标模型,一台用于训练 drafter。
该实现已被验证可迁移到 Qwen3.6-35B-A3B、Gemma-4-31B-it、GLM-5.2 等模型,以 Hugging Face 兼容格式打包,vLLM 可直接加载。
「Infra」频道最新
- Hyperbolic 招量化研究员:要把 GPU 算力做成可交易资产 — YiMaTweets · 2026-09-18
- 算力公司 Crusoe 融资 39 亿美元,估值达 309 亿 — beffjezos · 2026-09-18
- Periodic Labs 仅用 1300 块 H200 训出超 GPT-6 的科学模型 — hsu_byron · 2026-09-18
- Bonsai 量化模型 128k 上下文跑出 50 tok/s,24GB 卡可双开 — julianharris · 2026-09-18
- Jeff Dean 力挺专用硬件:少数工作负载将占全球大部分算力 — AccBalanced · 2026-09-18
- Silicon Data 图表显示英伟达 GPU 残值远高于直线折旧曲线 — AccBalanced · 2026-09-18