Meta 研究员称 coding-agent 基准已接近饱和,需转向目标导向评测
agihouse_org · x · 2026-07-28
coding-agent 基准为什么要换一套范式
Kilian Lieret 目前是 Meta 的 AI 研究员,曾在普林斯顿任职,也参与过 SWE-agent、mini-SWE-agent、CodeClash 和 ProgramBench 等开源项目。这场研究分享的核心观点是:如果基准只衡量“任务有没有做完”,agent 评测很快就会进入饱和。
文章梳理了从 HumanEval 到 SWE-bench 的评测演进:前者让代码生成变得可量化,后者把模型推进到真实软件工程场景;但随着 SWE-bench 风格测试逐渐趋于饱和,下一阶段需要转向 目标导向 的评测,而不是只看是否符合某个规格说明。
重点内容
- 评测对象要从“完成任务”升级为“追求高层目标”:看模型能否持续迭代、竞争、改进。
- CodeClash:让模型写出来的代码彼此竞争,用来观察自我改进循环。
- ProgramBench:检验模型能否仅凭黑箱行为重建程序。
- 行为测试和反作弊 是 agent 评测里不可或缺的一环。
- 现阶段模型在 日志、记忆、 grounded iteration 上仍然吃力。
- 未来也许是 多智能体脚手架 先显出优势。
「编程与Agent」频道最新
- Alchemy 新增 Kubernetes 文档中心,从 kind 集群到 EKS 部署全流程 — samgoodwin89 · 2026-09-23
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- 小米发布 MiMo-V2.6:开源模型 AA 智能指数 46 分居首 — burny_tech · 2026-09-23
- 「还记得 Tab 补全吗」:编码方式两年间的狂飙变迁 — yoobinray · 2026-09-23
- 调查:1/4 的 AI Agent 处于无人监控状态 — rseroter · 2026-09-23
- 警惕「提示词债务」:自然语言不是可靠的系统规格语言 — dbreunig · 2026-09-23