Meta 研究员称 coding-agent 基准已接近饱和,需转向目标导向评测

agihouse_org · x · 2026-07-28

coding-agent 基准为什么要换一套范式

Kilian Lieret 目前是 Meta 的 AI 研究员,曾在普林斯顿任职,也参与过 SWE-agent、mini-SWE-agent、CodeClash 和 ProgramBench 等开源项目。这场研究分享的核心观点是:如果基准只衡量“任务有没有做完”,agent 评测很快就会进入饱和。

文章梳理了从 HumanEval 到 SWE-bench 的评测演进:前者让代码生成变得可量化,后者把模型推进到真实软件工程场景;但随着 SWE-bench 风格测试逐渐趋于饱和,下一阶段需要转向 目标导向 的评测,而不是只看是否符合某个规格说明。

重点内容

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →