亚马逊论文:LLM 评委做 Agent 评估时 57.5% 满意对话实际任务失败

dair_ai · x · 2026-09-14

Amazon 的新论文系统检验了「LLM 用户模拟器 + LLM 评委给对话打分」这一常见 agent 评估范式,发现它在两个具体方面失效:

研究覆盖 6 家厂商的 25 个 agent,基于 tau2-bench 和 SimulatorArena。评委还偏袒与自己同一家族的模型。

修复成本低:免评委的 completion 位可捕捉截断回归,评委仅在对照 ground truth 校准后才可信。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →