三星 LittleBit 实现 0.1bit 极限量化,Llama2-13B 压至 0.9GB
jon_durbin · x · 2026-10-08
三星研究院发布 LittleBit,一种面向亚 1bit 极端的 LLM 量化方法:
- 核心思路:用低秩隐矩阵分解表示权重,再对因子做二值化,目标 0.1 bits per weight,内存压缩近 31 倍(Llama2-13B 压到 0.9GB 以内)。
- 补偿机制:多尺度补偿(行、列及按秩学习的隐维度),配合 Dual-SVID 稳定量化感知训练(QAT)初始化,以及残差补偿缓解误差。
- 效果:Llama2-7B 上 0.1 BPW 的表现超过此前最优方法的 0.7 BPW;内核级基准显示相对 FP16 有约 5 倍加速潜力,为资源受限环境部署大模型铺路。
所属事件:三星开源 LittleBit:13B 模型压至 1GB 以内(4 条相关)→
「研究」频道最新
- 论文解码 31 万加密推理块,恢复出 367 条隐私与 182 个凭证 — DynamicWebPaige · 2026-10-10
- Fchollet 长文:科学才是最好的递归自我改进系统,进步实为线性 — fchollet · 2026-10-10
- MIT 学者播客谈 AI 冲击数学界:OpenAI 已给出 Navier-Stokes 证明 — JustinMSolomon · 2026-10-10
- DeepSeek-V4 答案随 2 token 注入翻转,NIAH 波动达 40 分 — Francis_YAO_ · 2026-10-10
- Berkeley 迎来新博士后:研究尊重经济激励的 ML 系统 — nhaghtal · 2026-10-10
- GenAI4World workshop 登场 COLM 2026,含演讲与圆桌环节 — m2saxon · 2026-10-10