SWE-sweep 新基准:考模型能否在用户踩坑前主动找出 bug

klieret · reddit · 2026-10-02

Meta、Stanford、Harvard、UW 研究者联合推出新基准 SWE-sweep,思路与主流 SWE 基准相反:不再让模型修用户已遇到的 bug,而是把一个大型真实代码库交给 agent,让它在隐藏的真实 bug 集上尽量多地找出并修复。

所属事件:Meta 等机构发布 SWE-sweep:最强模型无监督找 bug 仅修 4.7%(6 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →