26人团队提出ABC清单:Agent基准设计缺陷可致成绩误估高达100%
ddkang · x · 2026-09-19
来自 UC Berkeley、Stanford 等机构、由 Percy Liang、Matei Zaharia、Ion Stoica、Daniel Kang 等署名的论文指出,当前大量 agentic benchmark 在任务设置与奖励设计上存在缺陷:
- SWE-bench Verified 测试用例不足;TAU-bench 把空回复计为成功,此类问题会导致 Agent 能力被相对高估或低估最多 100%
- 团队据此提出 Agentic Benchmark Checklist(ABC):一套从基准构建经验、最佳实践调研和已报告问题中总结的评估规范
- 在评估设计复杂的 CVE-Bench 上应用 ABC 后,性能高估幅度减少了 33%
论文共 39 页,含 15 张表、6 张图,为构建严谨的 Agent 评测提供了可操作指南。
「编程与Agent」频道最新
- Greg Kamradt:带 AI 的人类仍比 AI 带 AI 更高效 — GregKamradt · 2026-09-19
- 前搜索从业者:Jev 或让 agent 的工具调用路由回归判别式模型 — multiply_matrix · 2026-09-19
- Box CEO 演示用 Jev 做即时文件分类路由,几乎零成本 — multiply_matrix · 2026-09-19
- Walrus Memory 推出可跨应用与模型的 Agent 便携记忆 — udmrzn · 2026-09-19
- 把 Jev 做成 if 语句:实验性编程语言「Probably」亮相 — ritakozlov · 2026-09-19
- Notion 自研 CRDT 协同编辑:每分钟处理数百万次操作 — dejavucoder · 2026-09-19