15 个本地模型工具调用实测:qwen3.8-27B 居首,Bonsai 27B 垫底

Reno0vacio · reddit · 2026-10-05

作者用 Toolery 基准(143 个场景 × 3 次尝试 = 每模型 429 次,分 Easy 到 Very Hard 四档,统一 30k 上下文、温度 0.8,经 LM Studio 本地运行)实测了 15 个本地模型的 agent/工具调用能力。

主要结果:

作者注明测的是初代 Bonsai 27B 而非 Bonsai 2,该结果只说明约束下的工具调用表现,不代表模型综合水平。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →