llama.cpp修复MTP性能Bug,Qwen模型端侧推理提速10%
solyarisoftware · x · 2026-07-29
llama.cpp 修复了一个关于 MTP(Multi-Token Prediction)的性能 Bug。此前在使用 --fit 加载 MTP GGUF 模型时,程序未将 NextN/MTP 块计入 ngpulayers,导致少卸载了一层到 GPU,使第 0 层滞留在 CPU 上运行,并意外禁用了融合 Gated Delta Net GPU 内核,拖慢了生成速度。
该修复(PR #26177)已包含在 b10152 版本中。实测表明,修正后正确计算了 MTP 块,使模型前层得以保留在 GPU 上,使用 Qwen3.6-35B-A3B 模型的 Token 生成速度提升了约 10%。
所属事件:llama.cpp一行代码修复Bug,Qwen端侧推理提速10%(2 条相关)→
「Infra」频道最新
- TorchSpec 实现大规模分离式推测解码训练,已被腾讯混元等采用 — zhyncs42 · 2026-07-30
- 1100 行代码实现本地 LLM 轻量级代理与限流工具 — Yulya_N8FAD85042 · 2026-07-30
- OpenAI 称 GPT-5.6 Sol 实现自我优化:服务成本降 20% — OpenAI · 2026-07-30
- 微软Meta财报亮眼:AI基建投入翻倍,云与广告收入强劲增长 — luisdans · 2026-07-30
- 端侧 AI 普及将带来海量存储需求,硬盘厂商或成分红者 — cocktailpeanut · 2026-07-30
- Meta 财报后股价盘后暴跌 9%,AI 巨额支出拖累利润率与现金流 — ivan_bezdomny · 2026-07-30