本地 2-bit 小模型当编程 Agent 裁判:一致率 66%,是自带裁判的 2 倍

Cultural_Self8980 · reddit · 2026-10-06

作者在 Ternary-Bonsai-4B(2-bit 打包权重约 1.1GB,Apple Silicon MLX 后端)之上搭了一个本地「System One」判别器:单条记录一次前向就能回答多选、评分或是否类问题。关键实现是共享记录前缀的树状注意力掩码——每个问题只关注记录和自己的分支,互不可见,权重完全冻结、无微调。

一个落地场景是编程 Agent 裁判:作者发布了 omp 插件,用本地模型做 omp 的自动 thinking-effort 选择,另提供可选的模型路由器。在 80 个真实编码请求上测试,Bonsai 与 Claude Opus 参考标签的精确一致率为 66%,远高于 omp 内置 LFM2-1.2B 的 29% 和 LFM2.5-230M 的 25%;M2 上中位延迟分别为 0.8s / 3.0s / 0.3s。

作者也列出局限:参考标签来自同一个 Opus 模型而非人类,样本仅 80 条,且 omp 给 Bonsai 四档、给内置裁判三档,比较的是实际配置而非同一标签空间;Bonsai 倾向评低一档(如选 high 而非 xhigh),模型路由器的选择准确率尚未评测。代码与基准已开源于 GitHub。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →