三星开源 LittleBit:0.1 比特量化压 13B 模型至 1GB 内

三星研究院开源 NeurIPS 论文 LittleBit,一种面向亚 1bit 的极端 LLM 量化方法:不按标准数值存储权重,而是用低秩隐矩阵分解表示权重再对因子二值化,目标 0.1 bits per weight。该方法可将 Llama2-13B 等 130 亿参数模型压缩到 1GB(0.9GB)以内,同时推理速度提升达 11.6 倍。

2026-10-08 ~ 2026-10-09 · 3 条相关