llama.cpp 原生 MTP 在稠密模型上提速 1.4x–2.2x

UsedMorning9886 · reddit · 2026-07-25

llama.cpp 原生 MTP 在稠密模型上提速明显,MoE 收效有限

这条帖把 llama.cpp 里 speculative decoding 的现状做了一个集中梳理。

结论很直接:如果你现在想给本地推理提速,原生 MTP head 比老一代 draft-model trick 更靠谱。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →