Agent 评测该拆开:任务成功率不等于运行可靠性

PromptPhanter · reddit · 2026-09-09

作者批评当前 agent 评测把所有指标压缩成单一 pass/fail 通过率,掩盖了两类不同的失败:

作者主张分开打分:

被恢复的错误应保持可见,但不应把成功会话打成可靠性部分失败——其代价应记入浪费的支出和关键路径时间。

作者还强调必须验证外部状态:「没有异常」不等于成功,agent 说邮件已发送但收件箱没有邮件就是失败。文末询问社区在长程工具调用评测中如何划这条界线。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →