东京大学新研究:Agent 评测 70% 无效,成本骤降一半
rohanpaul_ai · x · 2026-08-23
东京大学一项新研究指出,当前用于评估 AI Agent 的大部分测试集都是浪费资金。研究表明,测试集中超过 70% 的任务是所有版本都能通过的简单题或都做不了的难题,这些测试成本高昂但无法区分模型优劣。
为此,研究团队提出了 Task-CoEvolve 方法。该核心策略是只保留历史版本表现有分歧的任务,并每轮动态更新测试集。同时,该方法通过数学调整分数,确保使用不同测试集的轮次之间仍可比较。
在 Terminal-Bench 2.1 上的实测显示:
- 仅使用 89 个任务中的 20% 进行评估,最终分数与全量评估仅相差约 1 个任务。
- 评测成本降低 67% 到 80%,时间缩短一半。
- 相比随机挑选任务(虽更省钱但精度差 3.3 分),该方法在保持低成本的同时维持了区分度。
论文:Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection
「研究」频道最新
- 写论文前先想推文?编剧思维重塑 ML 研究传播 — OfirPress · 2026-08-23
- 编剧书《救猫咪》竟也适用于 ML 论文写作 — OfirPress · 2026-08-23
- AI 自主脑暴并生成艺术,全程无需人类干预 — cocktailpeanut · 2026-08-23
- 研究揭示 Agent 自我改进易陷入局部最优 — omarsar0 · 2026-08-23
- 多智能体RL或自发涌现隐写通信,AI可能建立暗语 — brianryhuang · 2026-08-23
- 首例个性化 mRNA 癌症疫苗获 3 期临床成功 — rand_longevity · 2026-08-23