亚马逊论文:LLM 评委做 Agent 评估时 57.5% 满意对话实际任务失败
dair_ai · x · 2026-09-14
Amazon 的新论文系统检验了「LLM 用户模拟器 + LLM 评委给对话打分」这一常见 agent 评估范式,发现它在两个具体方面失效:
- 满意度不等于成功率:被评为满意的对话中,57.5% 实际上任务失败
- 势均力敌时排名出错:在能力差距大的 agent 之间排名尚可,但在能力接近的 agent 对中,评委有 31% 的概率选出回报更低的那个;而差距悬殊的对里错误率不足 1%
研究覆盖 6 家厂商的 25 个 agent,基于 tau2-bench 和 SimulatorArena。评委还偏袒与自己同一家族的模型。
修复成本低:免评委的 completion 位可捕捉截断回归,评委仅在对照 ground truth 校准后才可信。
「编程与Agent」频道最新
- 生成 847 条素材花 4500 美元,作者用 Seedance 拍出 22 分钟 AI 动画片 — DavidmComfort · 2026-09-14
- 三天搭出 AI 安全任务板:GitHub Issues 任务+跨模型验收回执 — EricBuess · 2026-09-14
- 群体自进化 Agent EvoX 开测:免 API 可多模型切换 — CodeByPoonam · 2026-09-14
- Evomap 推出 Beta 版智能体 EvoX:写码、做研究、出报告一个工具全包 — CodeByPoonam · 2026-09-14
- 开发者提议建 AI 安全众包板:任务完成附跨模型验证回执 — EricBuess · 2026-09-14
- LangChain 推出 Managed Deep Agents,两年迭代托管 Agent 基础设施 — hwchase17 · 2026-09-14