Agent 评测关键在定义成功:同一模型成功率可差六成

Hugo Bowne-Anderson 以 Anthropic 的例子说明 Agent 评测中「成功」定义的关键性:同一 Agent 按不同口径统计,单次尝试成功率约 73%,三次独立尝试至少一次成功则高达约 97%,而按其他定义可能只有 39%。他还推出免费 Lightning Lesson 课程「AI Agent Evals」,讲解代码检查、LLM 评审与人工审核等评测方法的选择。

2026-09-21 ~ 2026-09-21 · 2 条相关