评测该标注覆盖边界:修好 bug 不等于完成整个工作流
Shahules786 · x · 2026-09-03
作者以 CRMArena-Pro 论文与《Designing Benchmarks for Knowledge Work》为依据,提出智能体评测的报告标准:
- 修好一个 bug 的编码 agent,未必处理了需求澄清、代码评审、文档、部署与团队交接;
- 检索到正确 CRM 记录的 agent,未必完成了受治理约束的完整工作流。
论文提出四个字段作为标准化报告框架:
- Represented activity:被测试的工作单元是什么;
- Tested setting:agent 拿到哪些工具、材料、角色、权限与工作流状态;
- Required work product:最终应留下什么产物或系统状态;
- Evaluated result:实际检验了该产物的哪些性质。
核心主张:排行榜应在分数旁边公布「覆盖边界」,benchmark 只测量工作的一片,不应悄悄宣称测了全部。CRMArena 原始实验也显示 SOTA LLM agent 在 ReAct 提示下任务成功率不足 40%,即便简化设置也低于 55%。
所属事件:哈佛/斯坦福论文提出知识工作基准四字段报告标准(2 条相关)→
「编程与Agent」频道最新
- 作者用 Atlas 全程 vibecode 出内容创作界面并公开流程 — gowthami_s · 2026-09-03
- 「i-have-adhd」skill 获 2.6 万星:治住编码 agent 埋答案的毛病 — tlakomy · 2026-09-03
- Keep MCP 让 agent 自动记笔记:同步两台 Mac 24/7 跑编码 agent — iannuttall · 2026-09-03
- Superpowers 作者:管 AI Agent 就像管聪明的初级工程师,生产力达 10 倍 — carsonfarmer · 2026-09-03
- 提示词工程本质是机制设计:为多智能体设计规则与反馈回路 — carsonfarmer · 2026-09-03
- LukeW 长文:开发者已同时监督上百个 agent,交互层正在换代 — LukeW · 2026-09-03