llama.cpp 新 PR 用 AVX2 加速大批量 IQ 量化推理
pmttyji · reddit · 2026-08-20
llama.cpp 社区提交了一个优化 PR,利用 AVX2 指令集显著加速了大批量场景下 IQ 量化模型的推理速度。基准测试显示,在 Qwen3.6-27B 和 35B-A3B 模型上,使用 IQ 系列量化(如 IQ3S, IQ2XS)时,Token 处理速度提升可达 6 倍至 12 倍以上,且对困惑度(PPL)影响极小。
「Infra」频道最新
- 广东与阿里签署战略合作,加码算力、AI 模型与芯片 — pstAsiatech · 2026-08-20
- 算力市场定价混乱:各平台 GPU 价格与指数脱节 — AccBalanced · 2026-08-20
- 双 3090 跑 Qwen3.8-27B 本地编码,50-65 tok/s 是否正常? — sugarfreecaffeine · 2026-08-20
- AVX-512 被指优于 ARM SVE:寄存器与掩码操作优势 — lemire · 2026-08-20
- Modular 开源平台仓库:集成 MAX 引擎与 Mojo 语言 — modular · 2026-08-20
- vLLM 混合精度导致 GRPO 不收敛的发现 — SergioPaniego · 2026-08-20