llama.cpp 原生 MTP 在稠密模型上提速 1.4x–2.2x
UsedMorning9886 · reddit · 2026-07-25
llama.cpp 原生 MTP 在稠密模型上提速明显,MoE 收效有限
这条帖把 llama.cpp 里 speculative decoding 的现状做了一个集中梳理。
- 新的 --spec-type draft-mtp 允许模型直接使用自带的 MTP head,不用再依赖单独的 draft model。
- Qwen3.6、DeepSeek、GLM 都已经带有可用的 MTP head。
- 今年 4 月合并的 speculative checkpointing 机制,是让混合/循环式架构也能可靠回滚的基础。
- 真实效果按架构分化很大:
- 稠密模型:加速比较实在,像 Qwen3.6-27B dense 有人报告能到 1.4x–2.2x。
- MoE 模型:提升小得多,甚至可能没有,因为每步解码本来就只激活少量参数,可优化空间更小。
- 作者还提醒,老式 speculative decoding——比如单独的小 draft model、n-gram matching——第三方验证结果并不稳定;在 Qwen3.6-35B-A3B 的一些细测里,甚至出现没有净提速、个别配置反而变慢的情况。
结论很直接:如果你现在想给本地推理提速,原生 MTP head 比老一代 draft-model trick 更靠谱。
「编程与Agent」频道最新
- Headroom 宣称最多省 95% token,代码智能体实测更接近 20% — alex_verem · 2026-07-25
- Bindu Reddy:自我改进 AI 代理可让应用成本降 10 倍 — bindureddy · 2026-07-25
- CachyLLama 把 KV 缓存落盘,15,700 token 提示词降到 1 秒内 — UsedMorning9886 · 2026-07-25
- OpenAI 230 美元 Codex keypad 加了推理强度旋钮 — HaktanSuren · 2026-07-25
- Claude 搭出 NBER 390 场讲座搜索页,直跳视频起点 — joshgans · 2026-07-25
- 用AI Agent搞定全网调研,极客分享买铂金包的硬核操作 — teodorio · 2026-07-25