纯 C CPU 推理引擎在 Xeon 上跑到 36 tok/s
shifu_legend · reddit · 2026-07-23
纯 C 写的 CPU LLM 推理引擎,Xeon 上比 bitnet.cpp 快 1.8×
作者发布了 Project Zero:一个用纯 C99 写的、零外部依赖 的 CPU-only LLM 推理引擎。其在同一台 Xeon 机器上声称比 bitnet.cpp 快 1.8×,在 Intel Xeon Emerald Rapids 4C 上跑到 36.25 tok/s,而 bitnet.cpp 为 19.33 tok/s。
支持的模型
- Microsoft BitNet b1.58-2B-4T:三值权重,带完整 REPL / agentic loop
- Qwen Bonsai-27B:直接读 GGUF,通过零拷贝 mmap 加载,作者称在低内存机器上也不易 OOM
加速思路
- BitNet 权重是三值打包
- 不再走“解包 → float → FMA”,而是用 3 条 VBMI 指令 直接喂给 INT8 VNNI 累加
- 线程池用 C11 atomic 的 spin-then-sleep,减少 futex 系统调用
还在找社区数据
作者目前只在两台机器上做了测试,希望社区补充更多 x86 CPU benchmark,尤其是老 AVX2 机器和高核 Xeon/EPYC,上报 BitNet 和 Bonsai-27B 的 token rate。
「编程与Agent」频道最新
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11