llama.cpp修复MTP性能Bug,Qwen模型端侧推理提速10%

solyarisoftware · x · 2026-07-29

llama.cpp 修复了一个关于 MTP(Multi-Token Prediction)的性能 Bug。此前在使用 --fit 加载 MTP GGUF 模型时,程序未将 NextN/MTP 块计入 ngpulayers,导致少卸载了一层到 GPU,使第 0 层滞留在 CPU 上运行,并意外禁用了融合 Gated Delta Net GPU 内核,拖慢了生成速度。

该修复(PR #26177)已包含在 b10152 版本中。实测表明,修正后正确计算了 MTP 块,使模型前层得以保留在 GPU 上,使用 Qwen3.6-35B-A3B 模型的 Token 生成速度提升了约 10%。

所属事件:llama.cpp一行代码修复Bug,Qwen端侧推理提速10%(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →