纯 C99 单引擎同时跑 BitNet 与 GGUF,Xeon 上 36 tok/s
shifu_legend · reddit · 2026-09-15
开发者用纯 C99 从零写出推理引擎 Project Zero,单个二进制同时支持 BitNet 三值模型和常规 GGUF 模型,不依赖 Python 和 CUDA,只需 GCC 和 make。Xeon 上 BitNet b1.58-2B-4T 达 36 tok/s,约比 bitnet.cpp 快 1.8 倍;i5-11300H 上 SmolLM2 F16 约 100 tok/s,该路径比 llama.cpp 慢约 7%。最大难点是 ternary packing 的 AVX-512 内核调优需避免破坏缓存;Q4K 路径仍明显落后 llama.cpp(DeepSeek 上 1.9 vs 13.7 tok/s)。提供 OpenAI 兼容 API(/v1/chat/completions)与 SSE 流式输出,Linux x86 预编译二进制已发布。
「Infra」频道最新
- 史上最大芯片支出潮在即,恐慌抛售 AI 芯片股是误判? — firstadopter · 2026-09-15
- 矿卡 CMP 170HX 刷 64GB 显存、1.49TB/s 带宽,改装实测启动 — _Boffin_ · 2026-09-15
- NVIDIA 四张 B200 跑 Nemotron 3 Ultra,优化后并发用户提升 2.5 倍 — NVIDIAAI · 2026-09-15
- 本地跑模型到底花多少电费?开发者给 harness 加了成本计算器 — giveen · 2026-09-15
- Hugging Face 团队梳理:哪些开源 LLM 最适合端侧推理 — NielsRogge · 2026-09-15
- 开发者求助:用 ChatGPT 订阅 OAuth 顶替 API 做生产应用可行吗 — builtforoutput · 2026-09-15