纯C99零依赖跑通BitNet:Xeon CPU实现36 tok/s推理
shifu_legend · reddit · 2026-08-09
开发者从零构建了一个纯 C99 的 CPU 推理引擎,无需 Python、CUDA 或 BLAS 即可原生运行 BitNet 1.58-bit 三值模型。
核心技术与性能:
- 在 Intel Xeon 上使用 4 线程跑 BitNet b1.58-2B-4T 达到 36.25 tok/s。
- 利用原生三值 SIMD:权重按每字节 4 个打包,通过自定义 AVX2/AVX-512 和 VNNI 指令直接在整数寄存器中累加,避免了向 float32 解包的开销。
- 极简运行时:线程池使用 C11 原子操作配合自旋退避,几乎零同步开销,最终编译为单一独立二进制文件并提供 OpenAI 兼容 API。
瓶颈与启示:
- 遇到了 DRAM 带宽上限。在 batch size 为 1 时,解码速度受限于内存带宽,当前已达到理论带宽的 95%,单纯优化底层矩阵乘法计算已无法提升端到端延迟。
「Infra」频道最新
- AI算力打破美国用电停滞,终结反增长思维 — AndyMasley · 2026-08-09
- 亚马逊为德州数据中心建专属电厂,或成全美最大温室气体排放源 — The Verge AI · 2026-08-09
- 升级 PyTorch 2.13 与 CUDA 13,Blackwell 显卡视频渲染分辨率翻倍 — Chemical-Bicycle3240 · 2026-08-09
- 训练10万亿参数模型需5万张以上GB300 — AccBalanced · 2026-08-09
- 亚马逊数据中心成全美最大污染源,AI算力扩张代价凸显 — geox · 2026-08-09
- 投资人 Matt Turck 呼吁:不应无视社区对 AI 数据中心的抵触 — mattturck · 2026-08-09