SLQ 将大模型量化到 3.3 bits/参数且还能提速

TheZachMueller · x · 2026-07-24

SLQ 把 LLM 量化做到 3.3 bits/参数,还能提速

这篇论文提出 SLQ(Statistically-Lossless Quantization),主张量化不必在“保持模型质量”和“加速推理”之间二选一。

代码已开源到 IST-DASLab/SLQ。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →