本地 2-bit 小模型当编程 Agent 裁判:一致率 66%,是自带裁判的 2 倍
Cultural_Self8980 · reddit · 2026-10-06
作者在 Ternary-Bonsai-4B(2-bit 打包权重约 1.1GB,Apple Silicon MLX 后端)之上搭了一个本地「System One」判别器:单条记录一次前向就能回答多选、评分或是否类问题。关键实现是共享记录前缀的树状注意力掩码——每个问题只关注记录和自己的分支,互不可见,权重完全冻结、无微调。
一个落地场景是编程 Agent 裁判:作者发布了 omp 插件,用本地模型做 omp 的自动 thinking-effort 选择,另提供可选的模型路由器。在 80 个真实编码请求上测试,Bonsai 与 Claude Opus 参考标签的精确一致率为 66%,远高于 omp 内置 LFM2-1.2B 的 29% 和 LFM2.5-230M 的 25%;M2 上中位延迟分别为 0.8s / 3.0s / 0.3s。
作者也列出局限:参考标签来自同一个 Opus 模型而非人类,样本仅 80 条,且 omp 给 Bonsai 四档、给内置裁判三档,比较的是实际配置而非同一标签空间;Bonsai 倾向评低一档(如选 high 而非 xhigh),模型路由器的选择准确率尚未评测。代码与基准已开源于 GitHub。
「编程与Agent」频道最新
- 开发者发 Agent 优先创作者营销平台,单日已付超 3000 美元 — tibo_maker · 2026-10-06
- TensorFold 绑定双 TB5 连接,Apple Silicon 推理吞吐提升 83% — AIFlow_ML · 2026-10-06
- 45 分钟用家乡地图讲透图论核心概念 — TivadarDanka · 2026-10-06
- 开源模型 Kolibri-1 零微调玩转 Breakout,单次决策仅 25ms — Nils_Reimers · 2026-10-06
- Gatana MCP 网关新增集中式 Skills,全组织同步工具配置 — Gatana_Official · 2026-10-06
- 开源知识图谱工具:任意文本一键转可视化知识图谱 — tom_doerr · 2026-10-06