拆解智能体 Benchmark 提分:多少是真提升,多少是过拟合?

gregd_nlp · x · 2026-08-11

当前许多研究通过“框架进化”(Harness Evolution,即优化提示词、工具和编排代码等非参数化部分)来提升智能体系统的 Benchmark 得分。但一项新研究提出了一种名为 Harness Delta Attribution 的方法,用于拆解这些分数增长的真正来源。

研究发现,在 4 个基准测试中,许多看似惊人的分数提升实际上并非模型能力的泛化提升,而是源于对测试集的过拟合,或者是由于增加了测试时的计算量(Test-Time Scaling,如多次采样取多数)。作者呼吁未来的智能体评估应更加严谨地研究这些现象。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →