ExecCritic:测试-验证-修订框架将 Qwen3.5 SWE-bench 成绩提升 11.4 点

SharonYixuanLi · x · 2026-09-09

团队发布新研究 ExecCritic(Learn to Test, Test to Improve for Coding Agents),针对编码智能体的一个核心缺陷:当同一条轨迹既写补丁又写测试时,两者的错误可能「合谋」——错误补丁通过错误测试,看起来却像是对的。

论文的价值在于点破「写测试者和写补丁者不能是同一个错误源」这一问题,并用 RL 让智能体真正学会从测试反馈中改进。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →