llama.cpp新PR让CPU解码提速3倍,8B模型Q2_0量化破8 tok/s

BTA_Labs · reddit · 2026-08-07

llama.cpp 的一个新 PR(#26348)为 Q20 量化引入了 x86 VNNI 指令集优化,在纯 CPU 环境下实现了 3.0 到 3.6 倍的显著性能提升。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →