三星开源 LittleBit:13B 模型极限量化压进 1GB 内存

udmrzn · x · 2026-10-10

三星发表论文并开源 LittleBit,一种极限量化方法,能把 130 亿参数的大模型压缩到 1GB 以内。

核心做法:不按标准数值存储权重,而是用潜在因子分解把权重压到亚 1 比特级别,某些配置下每个权重仅需 0.1 bit。更激进的架构改动是:由于压缩到这个程度后可以「不再做数学」,LittleBit 把核心计算从浮点乘法替换为按位 XOR 异或运算,用符号翻转取代复杂矩阵运算。

实测带来最高 11.6 倍推理加速。有人类比:这相当于在一台 DGX Spark 上跑 Kimi-K3 级别的模型。若能落地生产环境,端侧本地部署的格局可能被改写。

所属事件:三星开源 LittleBit:13B 模型压至 1GB 以内(4 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →