Agent 基准该学简历:考 70 万美元 ARR 而非修 PR

menhguin · x · 2026-08-16

一位研究者在 X 上对比了两种 agent 评估思路:考试型基准(exam benchmark)会把任务限定为具体的短程问题,比如「解决某个 PR 的 bug 场景」,只能测出模型一次性处理代码库局部问题的能力;而「简历」(resume)式评估考察的是 agent 以自主方式匹配复杂的组织级目标,按一套「常规」但高度开放的评分标准打分。

他的具体建议:与其出「修这个 PR」的题,不如把任务设计成「自主部署 3 个 B2C 健康应用并做到 70 万美元 ARR」这类目标,并像评简历一样打分。他认为这种开放式评估方式现在就有实际价值。

所属事件:Agent评估应如简历:重长程复杂任务而非单题考试(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →