评测该标注覆盖边界:修好 bug 不等于完成整个工作流

Shahules786 · x · 2026-09-03

作者以 CRMArena-Pro 论文与《Designing Benchmarks for Knowledge Work》为依据,提出智能体评测的报告标准:

论文提出四个字段作为标准化报告框架:

核心主张:排行榜应在分数旁边公布「覆盖边界」,benchmark 只测量工作的一片,不应悄悄宣称测了全部。CRMArena 原始实验也显示 SOTA LLM agent 在 ReAct 提示下任务成功率不足 40%,即便简化设置也低于 55%。

所属事件:哈佛/斯坦福论文提出知识工作基准四字段报告标准(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →