26人团队提出ABC清单:Agent基准设计缺陷可致成绩误估高达100%

ddkang · x · 2026-09-19

来自 UC Berkeley、Stanford 等机构、由 Percy Liang、Matei Zaharia、Ion Stoica、Daniel Kang 等署名的论文指出,当前大量 agentic benchmark 在任务设置与奖励设计上存在缺陷:

论文共 39 页,含 15 张表、6 张图,为构建严谨的 Agent 评测提供了可操作指南。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →