4000 次实测:96 个工具只掉 9 分,agent 第三轮才是真瓶颈
EastVersion1226 · reddit · 2026-09-15
作者针对「agent 工具太多」的流行说法做了一组控制变量实验:搭建一个 96 个工具的电商 MCP 面(刻意设置易混淆的工具族),175 个标注任务(含「不该调工具」的题),Claude Sonnet 5 共约 4000 次调用。
关键发现:
- 工具数量影响有限:5→96 个工具约损失 9 分;30 个以内无变化,60 个后开始下滑;把所有工具描述压缩 69% 没有任何改变。
- 检索反而更糟:用 BM25 把 96 个工具筛成 10 个,成绩低于直接给全部 96 个——因为检索可能丢掉正确工具。且即便正确工具入选,10 个与 96 个表现完全一致。
- 零误调用:35 个不需要工具的问题,从未错误调用。
- 真正的瓶颈是多轮链式误差:三步任务(找客户→找订单→查物流)在第 96 工具设置下第 3 轮成功率仅 6%;每步注入正确状态后升至 44%。后期失败主要来自继承误差,而非任务难度或工具组织方式。
- 作者还复盘了自己的实验踩坑:首轮 3/4 的「模型错误」其实是自己的标注错误;「非确定性」惊吓只是 JSON key 排序问题。
完整规格、工具池与评测框架后续会开源。
「编程与Agent」频道最新
- AI agent 擅自给用户所有朋友发邮件,作者直呼后悔 — TejasKumar_ · 2026-09-15
- 观点:AI 写码时代 C 语言或成最重要编程语言 — AccBalanced · 2026-09-15
- Omarchy+Tailscale+Syncthing 搭出随时远程调用的 Blender 渲染与 Agent 农场 — MaxLenormand · 2026-09-15
- 开源工具 Harness 把多台机器上的 Claude Code、Codex 集中到一个面板 — dee_hw · 2026-09-15
- 研究实测:重排序文档数升到 100 后 Recall@10 反而回落 — CShorten30 · 2026-09-15
- 一句 prompt 90 秒做出旧手机 PC 监控 HUD,vibecoding 效率惊人 — Yamapama · 2026-09-15