SWE-sweep 基准出炉:最强模型自主修 bug 不足 5%

OfOf Press 团队联合 Meta 超级智能实验室及哈佛、华盛顿大学、斯坦福发布 SWE-sweep 基准,测试语言模型在不告知 bug 位置与类型的前提下,能否在真实仓库中自主发现并修复缺陷。基准覆盖 100 个真实仓库、约 4100 个真实 bug,结果显示最强模型修复率仅 4.7%。评测代码已在 GitHub 的 facebookresearch/swe-sweep 仓库开源,基于 Harbor 的轻量封装,可直接复现评测。

2026-10-01 ~ 2026-10-02 · 3 条相关