SWE-sweep 基准出炉:最强模型自主修 bug 不足 5%
OfOf Press 团队联合 Meta 超级智能实验室及哈佛、华盛顿大学、斯坦福发布 SWE-sweep 基准,测试语言模型在不告知 bug 位置与类型的前提下,能否在真实仓库中自主发现并修复缺陷。基准覆盖 100 个真实仓库、约 4100 个真实 bug,结果显示最强模型修复率仅 4.7%。评测代码已在 GitHub 的 facebookresearch/swe-sweep 仓库开源,基于 Harbor 的轻量封装,可直接复现评测。
2026-10-01 ~ 2026-10-02 · 3 条相关
- SWE-sweep 基准发布:顶尖模型无监督找 bug 成功率不足 5% — OfirPress · 2026-10-01
- Meta 团队发布 SWE-sweep:100 个仓库 4.1k 真实 bug,最强模型仅修复 4.7% — OfirPress · 2026-10-02
- SWE-sweep 基准代码开源:facebookresearch 仓库可直接复现评测 — OfirPress · 2026-10-02