Qwen3.6-27B 投机解码实测:DFlash 最快,最高提速 4.6 倍
thavoc77 · reddit · 2026-07-21
对 Qwen3.6-27B(dense、NVFP4)在单张 RTX PRO 6000 Max-Q 上的 speculative decoding 做了系统基准测试,横跨 vLLM 和 SGLang,方法包括 MTP / NEXTN、DFlash、EAGLE3、ngram,并保证同一客户端、每点 3 次重启采样以便可比。
主要结果
- DFlash 明显最好:SGLang 上约 3.3x,vLLM 上约 2.5x,在 math reasoning 子集上最高到 4.6x。
- MTP / NEXTN 大约 2.2x–2.8x,draft depth 越深速度提升越明显。
- EAGLE3 最高约 1.9x,在 K=3 之后基本不再提升。
- ngram 收益很小,只有 1.1x–1.3x。
工程踩坑
- EAGLE3 在 vLLM 上直接无法加载,hfhub 的 headdim 校验会报错;只能在 SGLang 上跑,还需要打补丁版本。
- DFlash 在 SGLang 里一开始首 token 就崩,因为 sampler 对 lmhead 做了原始 matmul,而该 checkpoint 是 NVFP4 量化;把 head 先反量化即可。
- 另外还需要限制 max-running-requests,否则 mamba/GDN cache 会 OOM。
「Infra」频道最新
- Vercel 数据显示 Anthropic、OpenAI 和 Google 占 97.09% 调用份额 — cramforce · 2026-07-21
- NVIDIA 向 Vera Rubin AI 工厂部署 102.4 Tbps 交换机 — nvidia · 2026-07-21
- Suleyman 说微软在为 OpenAI 关系退出做准备,新芯片比 GB200 便宜 30% — thoefler · 2026-07-21
- 微软与 Mistral 达成数十亿美元协议,扩建欧洲 AI 基础设施 — The Decoder · 2026-07-21
- 投机解码让 Qwen3.6-27B 在单卡上起飞,高并发却会拖慢服务器 — luke_pacman · 2026-07-21
- NVIDIA 称 Blackwell Ultra 训 DeepSeek-V3 达每 GPU 1648 TFLOPs — NVIDIAAI · 2026-07-21