Qwen3.6-27B 投机解码实测:DFlash 最快,最高提速 4.6 倍
thavoc77 · reddit · 2026-07-21
对 Qwen3.6-27B(dense、NVFP4)在单张 RTX PRO 6000 Max-Q 上的 speculative decoding 做了系统基准测试,横跨 vLLM 和 SGLang,方法包括 MTP / NEXTN、DFlash、EAGLE3、ngram,并保证同一客户端、每点 3 次重启采样以便可比。
主要结果
- DFlash 明显最好:SGLang 上约 3.3x,vLLM 上约 2.5x,在 math reasoning 子集上最高到 4.6x。
- MTP / NEXTN 大约 2.2x–2.8x,draft depth 越深速度提升越明显。
- EAGLE3 最高约 1.9x,在 K=3 之后基本不再提升。
- ngram 收益很小,只有 1.1x–1.3x。
工程踩坑
- EAGLE3 在 vLLM 上直接无法加载,hfhub 的 headdim 校验会报错;只能在 SGLang 上跑,还需要打补丁版本。
- DFlash 在 SGLang 里一开始首 token 就崩,因为 sampler 对 lmhead 做了原始 matmul,而该 checkpoint 是 NVFP4 量化;把 head 先反量化即可。
- 另外还需要限制 max-running-requests,否则 mamba/GDN cache 会 OOM。
「Infra」频道最新
- NVIDIA 称 Nemotron 3 Ultra 在 RTL 芯片设计任务上达 97.1% — NVIDIAAI · 2026-07-27
- 本地 Qwen 模型驱动机械臂测试 78 款手机续航 — gappyvalley · 2026-07-27
- MiniBot 2.40 新增 xAI、HF Studio 和 vLLM 支持 — Creative-Type9411 · 2026-07-27
- 苹果智能眼镜、英伟达SK合作与携程51.79亿罚单汇总 — APPSO · 2026-07-27
- DeepSeek 融资传闻、欧盟 AI 透明度规则与 OpenAI 安全事故 — 创业邦 · 2026-07-27
- QuixiCore 主张原生量化内核取代先反量化再执行 — QuixiAI · 2026-07-27