从零构建引擎:在免费 ARM 核心上超越官方三进制 8B 模型性能
Annual_Manner_5901 · reddit · 2026-08-22
作者展示了自研推理引擎 nucleo,在 Oracle 免费双核 ARM 实例上运行 Bonsai-8B 三进制模型,解码速度比官方 llama.cpp fork 提升 14%,预填充提升 55%。
核心数据对比:
- 2 核: nucleo 解码 2.8 tok/s,预填充 4.3 tok/s;官方分别为 2.46 和 2.77。
- 4 核: nucleo 解码 5.3 tok/s,预填充 7.7 tok/s;官方分别为 4.84 和 5.5。
技术实现:
- 引擎将模型转换为 2.125 bpw 交错格式(8B 模型仅 2.2GB)。
- 关键循环使用 NEON 内核,以 int32 精度累积 128 权重块,确保批处理路径与单路径输出比特级一致。
其他信息:
- 准确率测试在部署环境得分为 19/20。
- 作者声明并非在所有平台(如 M3 芯片或 1.7B 模型)都超越 mainline llama.cpp。
「Infra」频道最新
- Anthropic 招募谷歌 TPU 创始人领导自研芯片团队 — dinabass · 2026-08-22
- ComfyUI 参数实测:cache-classic 显著优化 5090 显存占用 — EasternAd8821 · 2026-08-22
- Google Cloud:Token工程四大实用支柱 — rseroter · 2026-08-22
- Zhipu 资金充裕算力紧缺,或租美商 GPU 训 100T 模型 — teortaxesTex · 2026-08-22
- 数据中心就是数字工厂:无自建算力则无前沿主权 — yunta_tsai · 2026-08-22
- 英伟达战略投资电力基础设施,布局算力供应链 — BenBajarin · 2026-08-22