Intel 推 BITCOS 压缩法,把三元 LLM 压到 1.485 比特并提速最高 27%
burny_tech · x · 2026-09-21
Intel 研究人员提出 BITCOS 压缩方法,在不改动任何一个权重的前提下,把三元(three-ary)LLM 的存储压到传统 1.58-bit 理论线以下:
- 核心思路:利用三元模型中零权重异常多的特点。在 29 个三元 LLM checkpoint 上,零权重占比最高达 51.48%
- 效果:每权重仅需 1.485 比特,同时保持三元权重完全不变
- 实测:CPU 解码吞吐最高提升 18%,GPU 解码吞吐最高提升 27%——模型更小、内存搬运更少、推理更快
作者认为,这类压缩突破是 AI「逃出数据中心」的关键一环,对在 PC、手机、机器人和边缘设备上运行强大模型越来越重要。
「Infra」频道最新
- 轻量模型 Laya 将内置 Omarchy M,可本地跑在 Apple GPU 与 ANE 上 — Scobleizer · 2026-09-21
- Meta 宕机:Facebook 与 Instagram 数千用户同时无法访问 — Polymarket · 2026-09-21
- Agent 集群被 KV 缓存黑盒卡住,推理工程师抱怨缺手动控制 — Small_Luck8177 · 2026-09-21
- Laya 移植 MLX:M3 Max 本地跑智能体,速度比 Jev 快 50 倍 — sven_ai · 2026-09-21
- 美国经济里程碑:数据中心与信息处理硬件支出首超住房投资 — rohanpaul_ai · 2026-09-21
- 爆料称 iPhone 18 Pro 端侧跑 27B 模型速度翻倍,剑指 100B 本地运行 — MannyKayy · 2026-09-21