拆解智能体 Benchmark 提分:多少是真提升,多少是过拟合?
gregd_nlp · x · 2026-08-11
当前许多研究通过“框架进化”(Harness Evolution,即优化提示词、工具和编排代码等非参数化部分)来提升智能体系统的 Benchmark 得分。但一项新研究提出了一种名为 Harness Delta Attribution 的方法,用于拆解这些分数增长的真正来源。
研究发现,在 4 个基准测试中,许多看似惊人的分数提升实际上并非模型能力的泛化提升,而是源于对测试集的过拟合,或者是由于增加了测试时的计算量(Test-Time Scaling,如多次采样取多数)。作者呼吁未来的智能体评估应更加严谨地研究这些现象。
「编程与Agent」频道最新
- 智能体调用 93% 可用 30B 小模型,LangChain 实测降本 70% — LangChain · 2026-08-12
- 别让 AI 只做计划,让它生成 Markdown 清单 — JnBrymn · 2026-08-12
- AI 编码时代的代码质量,取决于你设的约束 — rseroter · 2026-08-12
- Agent跑十次成功率骤降:论文揭示计算机任务可靠性陷阱 — xwang_lk · 2026-08-12
- Cursor 被曝即将推出 Composer 3,社区期待评测数据 — kimmonismus · 2026-08-12
- 基于 x402 协议实现智能体反向查询来电号码 — MurrLincoln · 2026-08-12