Meta 研究员称 coding-agent 基准已接近饱和,需转向目标导向评测
agihouse_org · x · 2026-07-28
coding-agent 基准为什么要换一套范式
Kilian Lieret 目前是 Meta 的 AI 研究员,曾在普林斯顿任职,也参与过 SWE-agent、mini-SWE-agent、CodeClash 和 ProgramBench 等开源项目。这场研究分享的核心观点是:如果基准只衡量“任务有没有做完”,agent 评测很快就会进入饱和。
文章梳理了从 HumanEval 到 SWE-bench 的评测演进:前者让代码生成变得可量化,后者把模型推进到真实软件工程场景;但随着 SWE-bench 风格测试逐渐趋于饱和,下一阶段需要转向 目标导向 的评测,而不是只看是否符合某个规格说明。
重点内容
- 评测对象要从“完成任务”升级为“追求高层目标”:看模型能否持续迭代、竞争、改进。
- CodeClash:让模型写出来的代码彼此竞争,用来观察自我改进循环。
- ProgramBench:检验模型能否仅凭黑箱行为重建程序。
- 行为测试和反作弊 是 agent 评测里不可或缺的一环。
- 现阶段模型在 日志、记忆、 grounded iteration 上仍然吃力。
- 未来也许是 多智能体脚手架 先显出优势。
「编程与Agent」频道最新
- 36GB 显存下跑长时 Agent,哪款本地模型更合适 — hovikyan · 2026-07-28
- Vercel 为 eve agent 栈加入 Slack 事件钩子和会话控制 — cramforce · 2026-07-28
- 现代远程 MCP 已支持一键安装、OAuth 和内嵌 UI — haltakov · 2026-07-28
- 36GB 显存本地跑编码 Agent,Qwen 和 Llama 怎么选 — hovikyan · 2026-07-28
- 面向 SAP 和 Workday 的生产级 MCP 架构难题 — Emergency_Island_703 · 2026-07-28
- Agent 已能处理反馈,还能给自己做 onboarding 界面 — jasonkneen · 2026-07-28