BitNet 内核单测快 29 倍,端到端只剩 6–10%
shifu_legend · reddit · 2026-07-25
这是一条很典型的推理优化复盘:作者花两周做了一个看起来能把内核提速 29 倍 的 ternary matrix kernel,最后却发现端到端收益大概率只有 6–10%。
关键信息包括:
- 这是一个从零用 C99、gcc、make 写的 BitNet 风格三值模型推理引擎;
- 新的 AVX-512BW kernel 在单测里跑到 74.6 Gop/s,对比标量基线 2.5 Gop/s;
- 但在 Xeon 测试机上,BitNet decode 已经吃到约 95% 的 DRAM 带宽,说明瓶颈是内存而不是算力;
- 引擎本身可用:BitNet b1.58-2B-4T 在 4 线程、无 GPU 下可到 36 tok/s,也支持普通 GGUF 稠密模型。
这条帖子的价值在于提醒工程师:先 profile 对层,再庆祝 kernel 数字。
「Infra」频道最新
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11