llama.cpp一行代码修复Bug,Qwen端侧推理提速10%

llama.cpp 近期合并了一个针对多 Token 预测(MTP)性能 Bug 的修复 PR。此前在使用 --fit 加载 MTP GGUF 模型时,程序未能正确处理相关逻辑导致性能受限。开发者仅通过一行警告代码的修复,便有效解决了该场景下的性能瓶颈,使得 Qwen 等模型的端侧推理速度获得约 10% 的提升。

2026-07-27 ~ 2026-07-29 · 2 条相关