DSpark 在在线 SGLang 上蒸馏,B200 解码吞吐提升 1.89 倍
ying11231 · x · 2026-07-23
团队称,他们为 Inkling NVFP4 做了一个 DSpark speculator,并用 SpecForge 在一个在线运行的 SGLang serving 引擎上直接蒸馏,而不是依赖离线数据集。
关键变化
- 草稿模型是直接从目标模型在真实服务条件下的输出中学习。
- 这样做的目标,是让 accept length 在真实 batch size 下也能稳定,而不只是 benchmark 脚本里好看。
结果
- 在 8×B200、TP8、bs=64 下,相比非 speculative 基线,decode throughput 提升 1.89×。
- 在同样 batch size 下,比 Inkling 自带的 MTP 快 7–14%。
- 平均 accept length 为 3.66,在 GSM8K 上最高到 4.76。
方法细节
- 5 层 Qwen3 风格 DFlash 并行 draft backbone
- rank-256 Markov logit-bias head 处理块内依赖
- 逐位置 confidence head 预测是否会被接受
- 通过 40 万次在线重生成 从真实目标引擎蒸馏
团队表示,想复现的人可以在评论里找到 serving 命令。
所属事件:开源 DSpark 推测解码器使 Inkling 吞吐量提升 1.89 倍(3 条相关)→
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11