SLQ 论文宣称可近无损量化 LLM,并带来 1.7–3.6 倍加速
pmttyji · reddit · 2026-07-25
这篇论文提出一种介于“有损量化”和“完全无损量化”之间的新路线:statistically-lossless compression。
- 作者先定义了 task-lossless:量化后在零样本基准上的准确率仍落在自然采样波动范围内;论文显示,这种目标即使在很激进的 bit width 下也能实现。
- 随后又提出更严格的 distribution-lossless:要求量化模型的 next-token 分布与原模型几乎不可区分。
- 为了衡量这种“分布级保真”,论文提出 Expected Acceptance Rate (EAR),例如 EAR ≥ 0.99 可理解为在最优耦合下有 99% 的 token 一致率。
- 论文还证明了一个 gamma-squared variance law:对称量化相对非对称量化会让噪声方差按 γ² 放大,因此若追求分布级无损,非对称量化是必要条件。
- 基于 SLQ 这种 layer-wise non-uniform asymmetric 方法,作者报告在某些模型上可做到 低于 4 bit/参数 的 task-lossless 压缩、约 5–6 bit/参数 的 distribution-lossless 压缩,并在优化 kernel 下获得 1.7×–3.6× 的推理加速。
所属事件:SLQ论文实现大模型近无损量化与提速(2 条相关)→
「Infra」频道最新
- 前谷歌工程师 rakyll 透露:正专注 AI 底层栈开发 — rakyll · 2026-07-25
- GPT-5.6 智能体协作 40 小时,将 Kimi K3 类模型推理提速至 406 tok/s — nicodotdev · 2026-07-25
- llama.cpp 在 GPU offloading 的 MoE 测试里,E 核比 P 核更快 — dir3ctly · 2026-07-25
- Artificial Analysis 称 Opus 5 价格并不比 Fable 低多少 — WonderFactory · 2026-07-25
- AlphaFold 被用于重设计基因编辑蛋白,以提升安全性 — Steap-Edit · 2026-07-25
- NVIDIA Dynamo 集成 Squeeze Evolve,称成本最低降 3 倍 — james_y_zou · 2026-07-25