SLQ论文实现大模型近无损量化与提速

一项名为SLQ(Statistically-Lossless Quantization)的新研究提出了一种介于有损与完全无损量化之间的新路线。该论文指出,通过统计无损压缩技术,可以将大型语言模型量化至3.3 bits/参数,在保持近乎无损性能的同时,还能带来1.7至3.6倍的推理加速。这为降低大模型部署成本提供了有效方案。

2026-07-24 ~ 2026-07-25 · 2 条相关