llama.cpp 新 PR 用 AVX2 加速大批量 IQ 量化推理

pmttyji · reddit · 2026-08-20

llama.cpp 社区提交了一个优化 PR,利用 AVX2 指令集显著加速了大批量场景下 IQ 量化模型的推理速度。基准测试显示,在 Qwen3.6-27B 和 35B-A3B 模型上,使用 IQ 系列量化(如 IQ3S, IQ2XS)时,Token 处理速度提升可达 6 倍至 12 倍以上,且对困惑度(PPL)影响极小。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →