Agent 评测该拆开:任务成功率不等于运行可靠性
PromptPhanter · reddit · 2026-09-09
作者批评当前 agent 评测把所有指标压缩成单一 pass/fail 通过率,掩盖了两类不同的失败:
- 结果失败:agent 操作上稳定却做错了任务
- 可靠性问题:agent 完成了任务,但途中经历 provider 报错、工具调用失败和两次重试
作者主张分开打分:
- outcome:agent 是否真正达成了用户目标
- reliability:会话是否在没有未恢复的操作性故障下达到结构上可用的完成状态
被恢复的错误应保持可见,但不应把成功会话打成可靠性部分失败——其代价应记入浪费的支出和关键路径时间。
作者还强调必须验证外部状态:「没有异常」不等于成功,agent 说邮件已发送但收件箱没有邮件就是失败。文末询问社区在长程工具调用评测中如何划这条界线。
「编程与Agent」频道最新
- 年度免费开源 AI 工具清单:CloakBrowser 等 6 个项目盘点 — 0xsachi · 2026-09-10
- Codex 负责人 Tibo 深谈:为何用 Rust、开源以及 OpenAI 内部如何用 AI 写代码 — The Pragmatic Engineer · 2026-09-09
- 实体设备 Harness 提前至本周五发货,一个硬件管全部编码 Agent — dee_hw · 2026-09-09
- 用 iPhone 视频+CV 流水线训练网球私教模型,追踪球速与击球动作 — measure_plan · 2026-09-09
- 一个垂直 Agent 替掉 HVAC 公司整条 SaaS 栈,亲历复盘 — _AustinCalvert_ · 2026-09-09
- AI 工具遇脏数据自信输出错误结果,独立开发者求解法 — FamiliarSlide7685 · 2026-09-09