ExecCritic:测试-验证-修订框架将 Qwen3.5 SWE-bench 成绩提升 11.4 点
SharonYixuanLi · x · 2026-09-09
团队发布新研究 ExecCritic(Learn to Test, Test to Improve for Coding Agents),针对编码智能体的一个核心缺陷:当同一条轨迹既写补丁又写测试时,两者的错误可能「合谋」——错误补丁通过错误测试,看起来却像是对的。
- 提出新的 test-verify-revise 智能体框架,将测试与修订拆成显式环节
- 配套一套角色专属的 RL 训练方法,在该框架内训练智能体学会利用执行反馈改进补丁
- 在 SWE-bench Verified 上,将 Qwen3.5-35B-A3B 从 61.2% 提升到 72.6%,且评测时不依赖更强模型或 oracle 反馈
论文的价值在于点破「写测试者和写补丁者不能是同一个错误源」这一问题,并用 RL 让智能体真正学会从测试反馈中改进。
「编程与Agent」频道最新
- macOS 工具 AtAt 发布:任意输入框敲 @@ 即可唤起 Claude Code 等 agent — k7agar · 2026-09-09
- 一行提示搞定桌面美化:用 codex 在 NixOS 上配置 Niri — SIGKITTEN · 2026-09-09
- 用 Claude+MCP 把建站任务交给人类专家,睡一觉网站就上线 — BrakeTooLate · 2026-09-09
- 设计师直接 ship 网页与桌面应用:AI 编码工具改写分工 — jacob_posel · 2026-09-09
- Adobe for Slack 上线:Slackbot 可调用 70+ Adobe 工具生成内容 — rufusd · 2026-09-09
- 开发者抱怨:AI agent 正沦为又一个要天天盯的收件箱 — e7h4n_z · 2026-09-09