SLQ 将大模型量化到 3.3 bits/参数且还能提速
TheZachMueller · x · 2026-07-24
SLQ 把 LLM 量化做到 3.3 bits/参数,还能提速
这篇论文提出 SLQ(Statistically-Lossless Quantization),主张量化不必在“保持模型质量”和“加速推理”之间二选一。
- 论文先区分两种“无损”:
- 任务无损:零样本基准的准确率仍在自然采样波动范围内;
- 分布无损:量化后模型的 next-token 分布与原模型几乎不可区分。
- 作者还提出 EAR(Expected Acceptance Rate) 作为直观可解释的保真度指标,例如 EAR ≥ 0.99 可理解为 99% token 一致。
- 论文证明了一个方差定律:对称量化会让噪声方差相对非对称量化按 γ² 放大,因此想做分布级保真,非对称量化是前提。
- 实验上,SLQ 在部分模型上做到 低于 4 bits/参数的任务无损压缩,最低到 3.3 bits/参数;分布无损则可做到 5–6 bits/参数,并在优化 kernel 下获得 1.7–3.6× 的推理吞吐提升。
代码已开源到 IST-DASLab/SLQ。
「Infra」频道最新
- SpaceX 据称拒接 2028 年后 Falcon 9 客户,押注 Starship — BasedRaddka · 2026-07-24
- vLLM 推出实验插件,将注意力与 FFN 服务解耦 — vllm_project · 2026-07-24
- LangChain 将于 8 月 12 日讲解 agent 生产治理框架 — LangChain · 2026-07-24
- UBS 在 AI Day 后上调 AMD 目标价至 730 美元 — BenBajarin · 2026-07-24
- HCLTech 联合 Sarvam AI 和奥迪沙政府建 15 亿美元数据中心 — santoshpanda · 2026-07-24
- AMP 创始人呼吁为 AI 初创公司设计算力融资方案 — ctjlewis · 2026-07-24