BitNet 内核单测快 29 倍,端到端只剩 6–10%
shifu_legend · reddit · 2026-07-25
这是一条很典型的推理优化复盘:作者花两周做了一个看起来能把内核提速 29 倍 的 ternary matrix kernel,最后却发现端到端收益大概率只有 6–10%。
关键信息包括:
- 这是一个从零用 C99、gcc、make 写的 BitNet 风格三值模型推理引擎;
- 新的 AVX-512BW kernel 在单测里跑到 74.6 Gop/s,对比标量基线 2.5 Gop/s;
- 但在 Xeon 测试机上,BitNet decode 已经吃到约 95% 的 DRAM 带宽,说明瓶颈是内存而不是算力;
- 引擎本身可用:BitNet b1.58-2B-4T 在 4 线程、无 GPU 下可到 36 tok/s,也支持普通 GGUF 稠密模型。
这条帖子的价值在于提醒工程师:先 profile 对层,再庆祝 kernel 数字。
「Infra」频道最新
- AMD 回顾收购 ATI 二十年:CPU 与 GPU 合流 — DavidBennett__ · 2026-07-25
- 一个字段类型写错,远程 MCP 的生产 OAuth 全部失效 — Capedcrusader1923 · 2026-07-25
- AI agent 付真钱前,或许先得有支付保险 — danielbaker06072001 · 2026-07-25
- SkyPilot GitHub 星标破万,覆盖 25+ 云的 AI 基础设施 — skypilot_org · 2026-07-25
- 自建 Pi 集群:2500 美元绕开 1.5 万美元企业服务器 — brianrkelly · 2026-07-25
- 影子服务器:给无法直修的电力遗留系统做虚拟补丁 — lauriewired · 2026-07-25