三星开源 LittleBit:13B 模型压到 1GB,推理提速 11.6 倍
ChrSzegedy · x · 2026-10-08
三星开源了名为 LittleBit 的极限压缩方法,可把 130 亿参数的大模型压到 1GB 以内。
核心思路:
- 不按标准数值存储权重,而是用隐式分解(latent factorization)把权重压到极低比特,部分配置下达到每权重仅 0.1 bit。
- 压缩到这种程度后,直接把核心计算从浮点乘法换成 bitwise XOR(符号翻转),大幅简化矩阵运算。
实测结果:
- 相对标准 FP16 模型获得最高 11.6 倍推理加速。
- 显著降低内存占用和加载带宽。
- 在此前方法会灾难性失效的 sub-0.5 bit 极限区间仍保持鲁棒性。
这一方法可能改写模型部署规则,让超大模型在低端硬件上运行成为可能。
「Infra」频道最新
- MIT 科技评论:工业自主 AI 时代需要新的数据与治理框架 — nordicinst · 2026-10-08
- 博主调优本地配置跑到 100+ token/s,称再加内存条还能提升 — yangyi · 2026-10-08
- 双 DGX Spark 集群跑 Qwen3.8 MTP 版遇 stall,作者求 llama.cpp 启动参数 — Impossible_Art9151 · 2026-10-08
- 六年前的 A100 仍是 AI 论文最常引用的 Nvidia 芯片 — nathanbenaich · 2026-10-08
- 云厂商积压订单达 1.69 万亿美元,CoreWeave 季收 25.8 亿 — nathanbenaich · 2026-10-08
- 拆解 Chrome DecisionModel API:完整提示词与引擎实测 — dejanseo · 2026-10-08