SGLang 上的 DSpark 解码吞吐提升到 1.89 倍
BanghuaZ · x · 2026-07-23
一个面向 Inkling NVFP4 的 DSpark speculative decoding 实现,已经用 SpecForge 在真实的 SGLang 目标引擎上端到端训练完成。
- 在 8×B200 / TP8 / batch size 64 下,解码吞吐比非 speculative 基线提升 1.89×
- 在相同 batch size 下,比 Inkling 自带的 MTP 快 7–14%
- 平均 accept length 为 3.66,在 GSM8K 上最高到 4.76
实现要点:
- 5 层、Qwen3 风格的 DFlash parallel-draft backbone
- 用于块内依赖建模的 rank-256 Markov logit-bias head
- 逐位置 confidence head 预测可接受性
- 基于 40 万次 Inkling regenerations 做蒸馏
帖主还附了服务命令,邀请直接试用。
所属事件:开源 DSpark 推测解码器使 Inkling 吞吐量提升 1.89 倍(3 条相关)→
「Infra」频道最新
- 农民称数据中心在杀蜜蜂,担忧已指向粮食系统 — eyishazyer · 2026-07-23
- 多智能体系统真正难点在编排,不在推理 — njanChe1 · 2026-07-23
- 算上口型同步,AI 视频配音每成片分钟约 5 到 7 美元 — Madmahi25 · 2026-07-23
- Nebius 在芬兰展示首个 NVIDIA Vera Rubin NVL72 机架 — demian_ai · 2026-07-23
- Bittensor 一个子网把推理价格压到差不多一半 — markjeffrey · 2026-07-23
- 昇腾 SuperPOD 优化把 DeepSeek-V4 训练 MFU 提到 34.22% — pmttyji · 2026-07-23