SLQ 论文宣称可近无损量化 LLM,并带来 1.7–3.6 倍加速
pmttyji · reddit · 2026-07-25
这篇论文提出一种介于“有损量化”和“完全无损量化”之间的新路线:statistically-lossless compression。
- 作者先定义了 task-lossless:量化后在零样本基准上的准确率仍落在自然采样波动范围内;论文显示,这种目标即使在很激进的 bit width 下也能实现。
- 随后又提出更严格的 distribution-lossless:要求量化模型的 next-token 分布与原模型几乎不可区分。
- 为了衡量这种“分布级保真”,论文提出 Expected Acceptance Rate (EAR),例如 EAR ≥ 0.99 可理解为在最优耦合下有 99% 的 token 一致率。
- 论文还证明了一个 gamma-squared variance law:对称量化相对非对称量化会让噪声方差按 γ² 放大,因此若追求分布级无损,非对称量化是必要条件。
- 基于 SLQ 这种 layer-wise non-uniform asymmetric 方法,作者报告在某些模型上可做到 低于 4 bit/参数 的 task-lossless 压缩、约 5–6 bit/参数 的 distribution-lossless 压缩,并在优化 kernel 下获得 1.7×–3.6× 的推理加速。
所属事件:SLQ论文实现大模型近无损量化与提速(2 条相关)→
「Infra」频道最新
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11