单 CPU 跑百亿大模型:微软开源 1.58 bit 推理框架 BitNet
JafarNajafov · x · 2026-08-08
微软开源了名为 BitNet 的推理框架,能够在单个 CPU 上运行 1000 亿参数的大语言模型,无需 GPU 或云端算力。
核心技术
- 采用 1.58 bit 量化,权重仅为 -1、0 或 +1 的三进制,完全依赖 CPU 原生的纯整数运算。
性能表现
- 100B 模型在单 CPU 上可达 5-7 tokens/秒(约人类阅读速度)。
- 在 x86 架构上比 llama.cpp 快 2.37 至 6.17 倍,能耗降低 82%。
- ARM 架构(如 MacBook)速度提升 1.37 至 5.07 倍,内存占用减少 16 至 32 倍。
质量与影响
- 其旗舰模型 b1.58 2B4T 经过 4 万亿 token 训练,精度几乎无损, benchmark 表现与同规模全精度模型相当。
- 支持完全离线运行,适用于手机、IoT 设备及边缘硬件,彻底免除云端 API 费用。项目已获 27.4K Star,采用 MIT 许可证。
所属事件:微软开源BitNet框架:单CPU跑千亿大模型(2 条相关)→
「Infra」频道最新
- 分析称特斯拉电机磁铁经验或助马斯克攻克芯片 EUV 光刻 — beffjezos · 2026-08-08
- 前 OpenAI 联创 Greg Brockman 疑将投身芯片供应链 — beffjezos · 2026-08-08
- TensorLens:纯浏览器端检查 HF 模型量化分布的开源工具 — Brilliant-Hall1387 · 2026-08-08
- 内存供应告急:2027 年产能已被预订一空 — johnnyApplePRNG · 2026-08-08
- RTX 5090 实测跑 Cosmos3-Nano:FP8/FP4 量化突破 32GB 显存限制 — fengwang_2_718281828 · 2026-08-08
- 解决 MiniMax H3 旧显卡黑屏卡顿:FP16 混合精度修复提速 11 倍 — Bubbly_Lawfulness_43 · 2026-08-08