同一个 Agent 成功率 97% 还是 39%?取决于你怎么定义成功

hugobowne · x · 2026-09-21

Hugo Bowne-Anderson 用 Anthropic 的例子说明 agent 评测中「成功」定义的关键性:

三个数字描述的是同一个 agent,但对应完全不同的产品假设:如果你能同时检查多个代码修复方案并保留通过的那个,「几次内成功」就有价值;如果用户依赖 agent 每次都完成任务,关心的是稳定性。

作者将于 9 月 22 日(悉尼时间)/9 月 21 日(美东)开设免费 Lightning Lesson「AI Agent Evals: Test What Matters for Your Agent」,内容涵盖:把真实失败转化为评测用例、在代码检查/LLM 评审/人工审核之间做选择、验证对 agent 的改动是否真的有效。

所属事件:Agent 评测关键在定义成功:同一模型成功率可差六成(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →