三星开源 LittleBit:13B 模型极限量化压进 1GB 内存
udmrzn · x · 2026-10-10
三星发表论文并开源 LittleBit,一种极限量化方法,能把 130 亿参数的大模型压缩到 1GB 以内。
核心做法:不按标准数值存储权重,而是用潜在因子分解把权重压到亚 1 比特级别,某些配置下每个权重仅需 0.1 bit。更激进的架构改动是:由于压缩到这个程度后可以「不再做数学」,LittleBit 把核心计算从浮点乘法替换为按位 XOR 异或运算,用符号翻转取代复杂矩阵运算。
实测带来最高 11.6 倍推理加速。有人类比:这相当于在一台 DGX Spark 上跑 Kimi-K3 级别的模型。若能落地生产环境,端侧本地部署的格局可能被改写。
所属事件:三星开源 LittleBit:13B 模型压至 1GB 以内(4 条相关)→
「Infra」频道最新
- dotConf 演讲回放:用投机解码加速 llama.cpp 推理 — ngxson · 2026-10-10
- 德累斯顿芯片厂或走无EUV路线,浸润式多重曝光可撑7nm — pstAsiatech · 2026-10-10
- 分析师称 agentic CPU 研究与 NVIDIA Vera 基准结论一致,关注扩展路径之争 — BenBajarin · 2026-10-10
- Container 运行时 P95 延迟降至 731ms,两周再快 180ms — ritakozlov · 2026-10-10
- 亚马逊跟进微软宣布弃用数据中心交易保密协议,社区反对已致数百项暂停令 — TechCrunch AI · 2026-10-10
- 亚马逊放弃数据中心保密协议,同时 AI agent 开始接管用户信用卡 — TechCrunch AI · 2026-10-10