别等完美任务集:Agent 评测的冷启动比想象中小

sarahcat21 · x · 2026-09-21

针对「设计一套全面的任务与验证器太难」的常见抱怨,作者指出这并非启动 eval 的前提:你只需要几个好的任务,再加上分析结果与 trace 的手段,就能持续更新、追加任务,让 eval 随 agent 一起演进。被引文章 TLDR 是「先丑着开始,写 eval 就对了」——理解 eval 的价值,不必为完成任务花费指数级的 token 和时间。文中给出框架:Agent = 模型 + Harness。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →