SLQ 将大模型量化到 3.3 bits/参数且还能提速
TheZachMueller · x · 2026-07-24
SLQ 把 LLM 量化做到 3.3 bits/参数,还能提速
这篇论文提出 SLQ(Statistically-Lossless Quantization),主张量化不必在“保持模型质量”和“加速推理”之间二选一。
- 论文先区分两种“无损”:
- 任务无损:零样本基准的准确率仍在自然采样波动范围内;
- 分布无损:量化后模型的 next-token 分布与原模型几乎不可区分。
- 作者还提出 EAR(Expected Acceptance Rate) 作为直观可解释的保真度指标,例如 EAR ≥ 0.99 可理解为 99% token 一致。
- 论文证明了一个方差定律:对称量化会让噪声方差相对非对称量化按 γ² 放大,因此想做分布级保真,非对称量化是前提。
- 实验上,SLQ 在部分模型上做到 低于 4 bits/参数的任务无损压缩,最低到 3.3 bits/参数;分布无损则可做到 5–6 bits/参数,并在优化 kernel 下获得 1.7–3.6× 的推理吞吐提升。
代码已开源到 IST-DASLab/SLQ。
所属事件:SLQ论文实现大模型近无损量化与提速(2 条相关)→
「Infra」频道最新
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11