逆向 NPU 引擎格式,让 GGUF 跑速提升 1.5 倍
woolcoxm · reddit · 2026-08-28
作者逆向了 Axera AX8850 NPU 的引擎格式,发现了 int8 权重以两个 nibble 平面存储的布局,并实现了在加载时将 GGUF 权重直接修补到预编译引擎中,免去了模型转换步骤。该项目还修复了被误认为损坏的 batched-prefill 路径,最终在树莓派 5 上实现了比厂商官方运行时快 1.5 倍的解码速度(24.5 t/s)和 716 t/s 的提示词处理速度。作者详细分析了该 NPU 的性能瓶颈主要在于内存带宽而非算力。
「Infra」频道最新
- MacBook 加 4G 且合盖不休眠,Agent 将为 GDP 贡献数十亿 — gabriel1 · 2026-08-28
- 无服务器 V8 隔离环境被视为 Agent 运行未来 — tobowers · 2026-08-28
- 论文分析 MoE 训练中光互连的热调谐开销 — jwt0625 · 2026-08-28
- 设计可靠 LLM 网关:构建后端统一可信入口 — Mahmoud_Zalt · 2026-08-28
- LightGlue 推 ONNX 版:支持 TensorRT 与跨平台部署 — rsasaki0109 · 2026-08-28
- LLM 三次逃逸 VM,研究者重申沙箱需攻击面减缩 — dyn___ · 2026-08-28