同一个 Agent 成功率 97% 还是 39%?取决于你怎么定义成功
hugobowne · x · 2026-09-21
Hugo Bowne-Anderson 用 Anthropic 的例子说明 agent 评测中「成功」定义的关键性:
- 单次尝试成功率约 73%
- 三次独立尝试至少一次成功 ≈ 97%
- 要求三次全部成功则跌至 39%
三个数字描述的是同一个 agent,但对应完全不同的产品假设:如果你能同时检查多个代码修复方案并保留通过的那个,「几次内成功」就有价值;如果用户依赖 agent 每次都完成任务,关心的是稳定性。
作者将于 9 月 22 日(悉尼时间)/9 月 21 日(美东)开设免费 Lightning Lesson「AI Agent Evals: Test What Matters for Your Agent」,内容涵盖:把真实失败转化为评测用例、在代码检查/LLM 评审/人工审核之间做选择、验证对 agent 的改动是否真的有效。
所属事件:Agent 评测关键在定义成功:同一模型成功率可差六成(2 条相关)→
「编程与Agent」频道最新
- AI 两小时做出完整 MMO,资深程序员追问:技能不再被需要怎么办 — devontec · 2026-09-21
- 向智能体下指令新姿势:用 ChatGPT 听写口述需求再粘贴 — athyuttamre · 2026-09-21
- 换用 Jesse 智能体零成本击败我的世界末影龙,仅 7 分 6 秒 — BLUECOW009 · 2026-09-21
- 开发者花 3 天逆向 Instinct 记忆系统,60 行代码复刻同款 — iamrobotbear · 2026-09-21
- Code Contracts 开放格式:用注释给代码写下 Agent 可执行的契约 — aronchick · 2026-09-21
- 用户怒批 OpenAI Codex 重置机制:付费却不知限额何时恢复 — StewartalsopIII · 2026-09-21