参数越复杂合成越差,苹果 Agent Seer 只凭 MCP 规范造评测均分 0.911

Agent Seer: Synthesizing Scenarios from Specification Understanding

Harish Karumuri, Mahesh Vemula, David Lopes Pegna

cs.CL

2026-06-25

苹果提出 Agent Seer:只读 MCP 规范、不调真工具,四段流水线合成评测场景。七套 MCP 上工具调用均分 0.911,中小规格覆盖 100%,失败主因是参数取值。

这篇在解决什么

企业里给 Agent 接日历、项目管理、内部库已经常见,评测却一直冷启动。新 API、私有 MCP、还在改的工具套件没有现成场景;手写覆盖不了工具组合空间,固定基准会随接口过期,多轮对话还得跟具体工具返回挂钩。GAIA、AgentBench、MCPVerse 这类套件要么靠人工标注,要么要 live 调用,都解不了「这套工具刚上线、一张考卷都没有」的问题。

Agent Seer 的判断是:函数名、自然语言描述、类型化参数 schema 已经够 LLM 推断工作流、填参数、编造工具返回、再扩成多轮。瓶颈从找专家出题,变成从规范里抽语义。

方法

四段流水线,每段只吃上一段校验过的结构化输出,格式错了就卡在边界,不往下传。

产物是自包含评测包:prompt、期望工具序列、mock 返回、多轮对话、对 Agent 隐藏的 oracle。下游框架喂 mock、对照 oracle 打分,不必连真工具。生成器是 Gemini 2.5 Flash Lite,temperature 0.7,结构化输出失败最多重试三次再丢弃。

结果

评测放在七份公开 MCP 上,工具数从 Illustrator 的 64 到 Filesystem 的 14。共生成 337 条场景、391 条评测记录。主裁判 Gemini 2.5 Flash,temperature 0。

全库工具调用均分 0.911(95% bootstrap CI [0.897, 0.925],中位数 0.979),对话连贯均分 0.855(CI [0.838, 0.872])。31.7% 记录拿满分工具调用,只有 2.3% 掉到 0.5 以下。14 到 56 个工具的六份规格覆盖 100%;64 个工具的 Illustrator 掉到 56%,是这次唯一碰到的覆盖天花板。

MCP工具数均参数工具调用连贯性
Redis472.10.9660.902
Selenium561.80.9350.850
Elasticsearch201.80.9300.902
Illustrator643.60.8980.855
Slack162.20.8860.938
Filesystem141.80.8760.825
Git3311.20.8570.757

质量差主要跟参数 schema 绑在一起,跟工具数量关系更弱。MCP 粒度上,平均每工具参数数与工具调用相关 r=-0.60,可选参数比例 r=-0.66;工具数量只 r=+0.40。Git 只有 33 个工具,但平均 11.2 个参数、95% 可选,分数最低;Selenium 56 个工具、参数扁平,排到 0.935。拆到 222 个具体工具,参数数量和可选比例对工具调用仍是负相关(r=-0.29 / -0.30,p<0.001)。复杂场景相对简单档掉 7.3 个百分点工具调用、5.3 个百分点连贯;Elasticsearch 掉 12.2pp,Git 掉 11.1pp,Selenium 几乎不动。

失败切到子维度才看得清。Usage 近乎满分(98% 完美),Selection 77% 完美,Ordering 在多工具场景上 10% 零分。Arguments 只有 42% 完美、57% 部分正确。按最低子维归类,取值错误 223 条,相关性 44,格式 35,类型 31,完整性 16,参数名 11。Redis 的典型错法是 set 漏了可选过期字段:函数名、key、value 都对,粗粒度名字匹配会当满分。Git 还有预训练泄漏:三条场景写出 MCP 里没有的 fetch、revert、filter-repo,全库 893 次调用里 3 次幻觉,全部集中在 Git。

换阿里 Qwen3.5-122B-A10B-FP8 复打,工具调用配对 r=0.79,MCP 排名 Spearman ρ=0.86,均值几乎无偏移;连贯性绝对分差约 0.16,配对 r=0.42,最差 MCP 在两个裁判间对不上。工具调用分数比较稳,连贯性绝对值跟裁判走。

为什么重要

私有或刚上线的 MCP 套件最缺的是考卷。这套管线能在不连真服务的前提下,把规范变成可跑的回归包,适合工具数量中等、schema 扁平、需要跟着 API 改动重生基准的团队。它解决的是冷启动,人工基准并没有被换掉。

名字匹配过关不等于能用。参数取值才是主失败面,Git 这种高密度、多可选、同名参数语义漂移的套件,生成结果必须人工核参数。复杂场景平均再掉 7.3pp,多轮展开成功率只有 16%,别指望它直接产出 τ-bench 那种长对话。

局限与存疑

作者把最大风险写在前面:oracle 是 LLM 生成的,系统偏差跟着生成模型走,框架只适合找相对差距,不能当金标。这次 mock 跨调用独立生成,依赖链上的 ID 对不齐。Illustrator 64 工具覆盖 56%,更大规格没有对策。simple/complex 只靠 prompt 措辞,没有结构过滤器。七份 MCP、单一生成器 Gemini 2.5 Flash Lite,外加只有 54 条多轮记录,统计力度不够支撑普遍结论。

裁判和生成器都是 LLM。作者用更强的 Gemini 2.5 Flash 打更弱的 Flash Lite,再加跨家族复打,工具调用排名能站住;仍然没有人评对照。871 条 mock 全是 low grounding,合成返回的保真度没有外部锚。把这套分数读成「场景已经接近真实工作流」,证据不够。

术语

原文与代码

社区讨论

相关论文

全部论文解读