研究揭示 Agent 排行榜严重失真:特化排名掩盖真实泛化能力

dair_ai · x · 2026-08-14

DAIR.AI 发布的最新研究指出,当前的 AI Agent 排行榜充斥着噪音,排名往往反映的是模型在特定任务上的“特化”而非真实的泛化能力。

研究团队使用概化理论(Generalizability Theory)对 TheAgentCompany、tau-squared-bench 和 AppWorld 三个基准进行了四维度分解。结果表明,Agent 本身的主效应在所有数据集中的方差占比均不足 3%,而 Agent 与任务的交互项占比却高达 7% 至 23%。

更严峻的是,在最难的任务四分位数中,tau-squared 动作检查的可靠性从 0.752 暴跌至 0.000。此外,训练集的可靠性与留出集的可靠性呈现 -0.90 的强负相关,这意味着那些表面上看起来最可靠的评测设计,在实际部署时的复现效果最差。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →