Qwen3.6-27B 实测:量化越重,Spec Decode 越赚
thavoc77 · reddit · 2026-07-27
Qwen3.6-27B 的 speculative decoding 在更重量化下更快
这条 Reddit 基准贴给出了一组关于 Qwen3.6-27B 的 speculative decoding 实测:整体上,量化越重,spec decode 的收益越大。在 10 组 speculative 配置里,速度倍率基本都呈现 Q8 > Q6 > Q4 的排序。
主要结论
- 在相同深度下,acceptance rate 基本不受量化影响。
- 变慢的主要是 base step,因为权重字节数变大;而 draft+verify 的额外开销没有同步增加。
- NVFP4 + SGLang 是全局最快的量化/引擎组合。
- DFlash 是整体最快的 speculative 算法。
- Weaver 能超过 DFlash,但它是 fork-only、按目标定制的特例,不能当成通用方案。
- MTP 在各处都能排第二。
- EAGLE3 被前两者压制,更像无 DFlash drafter 时的备选。
- ngram 基本不值得用,只有约 1.03×,并发下甚至是负收益。
一个异常现象
作者还发现,llama.cpp 在 UD-Q4 上的 MTP 路径异常慢:
- Q4 MTP-3 的绝对 tok/s 甚至比 Q6 MTP-3 更低,
- 但两者 acceptance 相同,
- 这种现象无法用带宽解释,原因暂不清楚。
重要限制
作者强调,这只是一个单点、偏理想的上限样本:greedy、batch=1、短输出、单一硬件环境。并发越高,单流收益越小;上下文越长,收益也会进一步被压缩。当前结果也不包含准确率 A/B,因此还不能判断更重的量化值不值得为速度牺牲质量。
「Infra」频道最新
- min-p 设为 0.05 可提升 Laguna S2.1 质量 — antirez · 2026-07-27
- Cloudflare 验证页开始区分 AI agents 和真人 — shashib · 2026-07-27
- AgentPond 增加 Supabase 支持,把 traces 留在应用里 — MarcusSchiesser · 2026-07-27
- 有人把 SGLang 改到 4 张 V100 上跑 Qwen — Primary_Exchange21 · 2026-07-27
- 曝月之暗面将发布Kimi K3:2.8万亿参数,支持百万上下文 — johnseach · 2026-07-27
- ARM 在 SIGGRAPH 展示神经超采样与去噪 — palgorithm · 2026-07-27