纯 C99 单引擎同时跑 BitNet 与 GGUF,Xeon 上 36 tok/s

shifu_legend · reddit · 2026-09-15

开发者用纯 C99 从零写出推理引擎 Project Zero,单个二进制同时支持 BitNet 三值模型和常规 GGUF 模型,不依赖 Python 和 CUDA,只需 GCC 和 make。Xeon 上 BitNet b1.58-2B-4T 达 36 tok/s,约比 bitnet.cpp 快 1.8 倍;i5-11300H 上 SmolLM2 F16 约 100 tok/s,该路径比 llama.cpp 慢约 7%。最大难点是 ternary packing 的 AVX-512 内核调优需避免破坏缓存;Q4K 路径仍明显落后 llama.cpp(DeepSeek 上 1.9 vs 13.7 tok/s)。提供 OpenAI 兼容 API(/v1/chat/completions)与 SSE 流式输出,Linux x86 预编译二进制已发布。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →