SGLang 上的 DSpark 解码吞吐提升到 1.89 倍
BanghuaZ · x · 2026-07-23
一个面向 Inkling NVFP4 的 DSpark speculative decoding 实现,已经用 SpecForge 在真实的 SGLang 目标引擎上端到端训练完成。
- 在 8×B200 / TP8 / batch size 64 下,解码吞吐比非 speculative 基线提升 1.89×
- 在相同 batch size 下,比 Inkling 自带的 MTP 快 7–14%
- 平均 accept length 为 3.66,在 GSM8K 上最高到 4.76
实现要点:
- 5 层、Qwen3 风格的 DFlash parallel-draft backbone
- 用于块内依赖建模的 rank-256 Markov logit-bias head
- 逐位置 confidence head 预测可接受性
- 基于 40 万次 Inkling regenerations 做蒸馏
帖主还附了服务命令,邀请直接试用。
所属事件:开源 DSpark 推测解码器使 Inkling 吞吐量提升 1.89 倍(3 条相关)→
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11