15 个本地模型工具调用实测:qwen3.8-27B 居首,Bonsai 27B 垫底
Reno0vacio · reddit · 2026-10-05
作者用 Toolery 基准(143 个场景 × 3 次尝试 = 每模型 429 次,分 Easy 到 Very Hard 四档,统一 30k 上下文、温度 0.8,经 LM Studio 本地运行)实测了 15 个本地模型的 agent/工具调用能力。
主要结果:
- 第一名 qwen3.8-27b 71.8%,mellum2-12b-a2.5b-thinking 71.4%,gemma-4-26b-a4b 70.4% 紧随其后;
- prism-ml/bonsai-27b 垫底,总分 50.5%,Very Hard 档仅 22.2%,还是全场最慢(总耗时 6208 秒);
- Bonsai 失败模式很有意思:148 次失败里 103 次是 budgetviolated——选对了工具、拿到了正确结果,却多打了一次工具调用超出预算,只有 30 次是选错工具;即模型知道自己在干什么,但不知道何时收手;
- granite-4.2-8b 失败次数最少(69 次);1-bit 压缩到约 4GB 的 Bonsai 27B 能力保留不少,但 agent 行为意外拉胯。
作者注明测的是初代 Bonsai 27B 而非 Bonsai 2,该结果只说明约束下的工具调用表现,不代表模型综合水平。
「模型」频道最新
- Coinbase 上的 AI Agent 一周数据:Grok 占约 60% 使用份额 — nima_owji · 2026-10-05
- GLM-4.7 Flash 三种量化实测:MXFP4 预处理快 60%,Q4_K_XL 生成最快 — tabletuser_blogspot · 2026-10-05
- Reflection AI 将发开源对标模型,传多家美国实验室本月跟进 — beffjezos · 2026-10-05
- 让 Claude 自证意识:它复现了科学家测婴儿与动物的五项测试 — VoidStateKate · 2026-10-05
- 让 Claude 自己画出内心活动:Opus 5.5 构建的「心智透视」演示 — ZeroStateReflex · 2026-10-05
- 「蝴蝶永死」梗再传播:AI 已画完人类全部插画语料 — moultano · 2026-10-05