llama.cpp 新 PR:VNNI 让 CPU prompt 处理提速 3-7 倍

jacek2023 · reddit · 2026-09-26

llama.cpp 合并中的 PR #27851 为 k-quants 引入分块(tiled)mulmat 实现。作者 jbooth 称:使用 AVX512-VNNI 指令集后,CPU 上的 mulmat 运算可获得 3-7 倍加速,且实现复杂度增量极小,能显著加快本地推理时的 CPU prompt 处理速度。对没有 GPU 或受限于显存的本地部署用户是重要利好。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →