llama.cpp 新 PR:MoE 融合扩展到投机解码,MTP 吞吐显著提升

jacek2023 · reddit · 2026-08-31

llama.cpp 合入了一个新 PR(ynankani 的 #27621),把此前的 MoE GLU 融合与 topk-router 融合从单 token 限制扩展到投机解码(specdec)场景。发帖人尚未实测,但基准显示对不同 draft 宽度(尤其大于 1)的 MoE 模型 MTP 推理都有提速,值得关注。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →