96 个易混淆工具的 MCP 实测设计:企业 Agent 该如何选工具
EastVersion1226 · reddit · 2026-09-09
一位做企业级 Agent 的开发者提出一个待执行的实验设计:现有论文测试的工具集动辄上千且来自不相关来源,正确工具显而易见;而真实企业场景是约 100 个工具同属一个产品,错误答案常是正确工具的「兄弟」,如 getorderstatus vs getorderstatushistory vs getorderfulfillmentstatus,这一区间没人测过。
他设计了实验方案:
- 一个连贯的 96 工具面,手工标注易混淆工具家族
- 通过真实 MCP server 提供,对比三个前沿模型
- 核心问题一:性能损失来自「选择数量」还是「工具描述占据的 token」——答案决定该做 server 分片还是压缩 schema
- 核心问题二:损失与总工具数相关,还是只与领域内工具数相关
- 同时测量无需工具的查询是否被误调用,以及三轮对话中的错误累积
作者尚未运行实验,向社区求证:这是否已被已有工作解决?生产环境跑过 100+ 工具的人是否认同这个问题真实存在?
「编程与Agent」频道最新
- researcher 提出 agent 能力金字塔:evals 优先于后训练 — abeirami · 2026-09-10
- 年度免费开源 AI 工具清单:CloakBrowser 等 6 个项目盘点 — 0xsachi · 2026-09-10
- Codex 负责人 Tibo 深谈:为何用 Rust、开源以及 OpenAI 内部如何用 AI 写代码 — The Pragmatic Engineer · 2026-09-09
- 实体设备 Harness 提前至本周五发货,一个硬件管全部编码 Agent — dee_hw · 2026-09-09
- 用 iPhone 视频+CV 流水线训练网球私教模型,追踪球速与击球动作 — measure_plan · 2026-09-09
- 一个垂直 Agent 替掉 HVAC 公司整条 SaaS 栈,亲历复盘 — _AustinCalvert_ · 2026-09-09