东京大学新研究:Agent 评测 70% 无效,成本骤降一半

rohanpaul_ai · x · 2026-08-23

东京大学一项新研究指出,当前用于评估 AI Agent 的大部分测试集都是浪费资金。研究表明,测试集中超过 70% 的任务是所有版本都能通过的简单题或都做不了的难题,这些测试成本高昂但无法区分模型优劣。

为此,研究团队提出了 Task-CoEvolve 方法。该核心策略是只保留历史版本表现有分歧的任务,并每轮动态更新测试集。同时,该方法通过数学调整分数,确保使用不同测试集的轮次之间仍可比较。

在 Terminal-Bench 2.1 上的实测显示:

论文:Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →