llama.cpp新PR让CPU解码提速3倍,8B模型Q2_0量化破8 tok/s
BTA_Labs · reddit · 2026-08-07
llama.cpp 的一个新 PR(#26348)为 Q20 量化引入了 x86 VNNI 指令集优化,在纯 CPU 环境下实现了 3.0 到 3.6 倍的显著性能提升。
- 测试环境:AMD EPYC 9645 处理器(8核),禁用 GPU 和 BLAS,使用 Bonsai GGUF 模型。
- 性能飞跃:8B 模型的解码速度从 2.39 跃升至 8.20 tok/s;1.7B 模型提升达 3.26 倍。
- 消费级硬件潜力:参考实现发现,Intel 12-14 代桌面 CPU(如 i5-13400)此前因缺少 AVX-512 支持而静默错过了快速路径,修复后同样获得约 3.2 倍提速。
- 注意事项:该 PR 尚未合并,优化仅针对 Q20 量化,且在内核级别存在极微小的数值精度差异。
「Infra」频道最新
- 推测解码技术将改变大模型 API 训练条款 — charles_irl · 2026-08-07
- 180张消费级显卡混训:50B token任务中断百次仅增2%成本 — bittingthembits · 2026-08-07
- 前Meta研究员:Google内部基础设施仍是世界级,专为规模扩展而生 — finbarrtimbers · 2026-08-07
- Cloudflare 统一 Workers AI 与 AI Gateway 打造单一控制面 — michellechen · 2026-08-07
- 实测 Runpod B200 运行 MiniMax:10秒视频仅需不到2分钟 — Foreforks · 2026-08-07
- LiquidAI LFM2.5-2.6B 模型量化报告:可完美运行于树莓派 — crusaderky · 2026-08-07