DSpark 在在线 SGLang 上蒸馏,B200 解码吞吐提升 1.89 倍
ying11231 · x · 2026-07-23
团队称,他们为 Inkling NVFP4 做了一个 DSpark speculator,并用 SpecForge 在一个在线运行的 SGLang serving 引擎上直接蒸馏,而不是依赖离线数据集。
关键变化
- 草稿模型是直接从目标模型在真实服务条件下的输出中学习。
- 这样做的目标,是让 accept length 在真实 batch size 下也能稳定,而不只是 benchmark 脚本里好看。
结果
- 在 8×B200、TP8、bs=64 下,相比非 speculative 基线,decode throughput 提升 1.89×。
- 在同样 batch size 下,比 Inkling 自带的 MTP 快 7–14%。
- 平均 accept length 为 3.66,在 GSM8K 上最高到 4.76。
方法细节
- 5 层 Qwen3 风格 DFlash 并行 draft backbone
- rank-256 Markov logit-bias head 处理块内依赖
- 逐位置 confidence head 预测是否会被接受
- 通过 40 万次在线重生成 从真实目标引擎蒸馏
团队表示,想复现的人可以在评论里找到 serving 命令。
所属事件:开源 DSpark 推测解码器使 Inkling 吞吐量提升 1.89 倍(3 条相关)→
「Infra」频道最新
- 做 1 吉瓦数据中心,电网要先补 2 吉瓦 — anderssandberg · 2026-07-23
- MCP 2026-07-28 取消会话,协议改为无状态 — Substantial-Heat-321 · 2026-07-23
- Beff Jezos 称谷歌将在云和算力上投入 2000 亿美元以上 — beffjezos · 2026-07-23
- 阿里云镇武 M890 超节点已适配 Qwen3.8 推理 — zephyr_z9 · 2026-07-23
- 阿里巴巴商品页里出现了 5000 美元集装箱数据中心 — bronzeagepapi · 2026-07-23
- 20VC 聚焦 Kimi、OpenRouter、Fireworks 与 Nvidia 的 AI 市场争议 — 20VC · 2026-07-23