llama.cpp 新 PR:VNNI 让 CPU prompt 处理提速 3-7 倍
jacek2023 · reddit · 2026-09-26
llama.cpp 合并中的 PR #27851 为 k-quants 引入分块(tiled)mulmat 实现。作者 jbooth 称:使用 AVX512-VNNI 指令集后,CPU 上的 mulmat 运算可获得 3-7 倍加速,且实现复杂度增量极小,能显著加快本地推理时的 CPU prompt 处理速度。对没有 GPU 或受限于显存的本地部署用户是重要利好。
「Infra」频道最新
- 英伟达市值 5.4 万亿美元,超过英法德任一国股市总市值 — iamfakhrealam · 2026-09-26
- SemiAnalysis 拆解 DeepSeek V4.1 Flash:Engram 查表换 1.6 倍性价比 — teortaxesTex · 2026-09-26
- 三个月精选论文清单:LLM 分布式训练与推理入门路径 — East-Muffin-6472 · 2026-09-26
- vLLM 弹性专家并行:MoE 部署可在流量中动态增减 GPU — PyTorch · 2026-09-26
- AI数据中心投资转向:真基建胜过PPT故事 — TansuYegen · 2026-09-26
- 双 3060 跑 Qwen 27B Q4 量化,实测生成速度约 44-50 tok/s — jacek2023 · 2026-09-26