llama.cpp 推测解码叠加实测提速6倍
FantasticNature7590 · reddit · 2026-07-17
作者在 llama.cpp 上测试了多种 speculative decoding 方案,针对 Qwen 3.6 27B 做了组合对比:MTP、DFlash、n-gram 以及它们叠加后的效果。结论是:
- 在单轮随机提示词上,n-gram 贡献不大;
- 在“反复编辑已有代码”的多轮场景里,n-gram 会明显放大 DFlash 的收益;
- 最好的结果是在 18 轮迭代编码任务里达到 321.5 vs 53.5 tok/s,约 6.01x;仅维护/改代码阶段可到 7.5x;
- 该方案几乎不额外占显存,lookup table 放在主机内存。
帖子还给出了测试设置:LiveCodeBench、MATH-500、不同上下文长度的综合压测,以及使用的硬件与 llama.cpp 构建参数。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11