Qwen3.6-27B 投机解码实测:DFlash 最快,最高提速 4.6 倍
thavoc77 · reddit · 2026-07-21
对 Qwen3.6-27B(dense、NVFP4)在单张 RTX PRO 6000 Max-Q 上的 speculative decoding 做了系统基准测试,横跨 vLLM 和 SGLang,方法包括 MTP / NEXTN、DFlash、EAGLE3、ngram,并保证同一客户端、每点 3 次重启采样以便可比。
主要结果
- DFlash 明显最好:SGLang 上约 3.3x,vLLM 上约 2.5x,在 math reasoning 子集上最高到 4.6x。
- MTP / NEXTN 大约 2.2x–2.8x,draft depth 越深速度提升越明显。
- EAGLE3 最高约 1.9x,在 K=3 之后基本不再提升。
- ngram 收益很小,只有 1.1x–1.3x。
工程踩坑
- EAGLE3 在 vLLM 上直接无法加载,hfhub 的 headdim 校验会报错;只能在 SGLang 上跑,还需要打补丁版本。
- DFlash 在 SGLang 里一开始首 token 就崩,因为 sampler 对 lmhead 做了原始 matmul,而该 checkpoint 是 NVFP4 量化;把 head 先反量化即可。
- 另外还需要限制 max-running-requests,否则 mamba/GDN cache 会 OOM。
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11