Qwen3.6-27B 实测:量化越重,Spec Decode 越赚

thavoc77 · reddit · 2026-07-27

Qwen3.6-27B 的 speculative decoding 在更重量化下更快

这条 Reddit 基准贴给出了一组关于 Qwen3.6-27B 的 speculative decoding 实测:整体上,量化越重,spec decode 的收益越大。在 10 组 speculative 配置里,速度倍率基本都呈现 Q8 > Q6 > Q4 的排序。

主要结论

一个异常现象

作者还发现,llama.cpp 在 UD-Q4 上的 MTP 路径异常慢:

重要限制

作者强调,这只是一个单点、偏理想的上限样本:greedy、batch=1、短输出、单一硬件环境。并发越高,单流收益越小;上下文越长,收益也会进一步被压缩。当前结果也不包含准确率 A/B,因此还不能判断更重的量化值不值得为速度牺牲质量。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →