Meta 团队发布 SWE-sweep:100 个仓库 4.1k 真实 bug,最强模型仅修复 4.7%
OfirPress · x · 2026-10-02
Meta Superintelligence Labs 联合哈佛、UW、斯坦福推出新基准 SWE-sweep:给定真实仓库,agent 在无任何 bug 类型或位置提示下自行发现并修复尽可能多的 bug,共覆盖 100 个仓库、4100 个 bug。
首期排行榜(均用 mini-SWE-agent)要点:
- Sol 5.6 (xhigh) 以 4.7% 修复率居首,但花费高达 $7,230(每仓库约 $72.30、233 轮交互)
- Luna 5.6 (xhigh) 修复 2.5%,成本仅 $224,性价比突出
- Opus 5 (xhigh) 修复 1.3%,成本 $5,363
- Kimi K3 修复 0.6%,花费 $2,451
项目官网 swesweep.com 含排行榜与论文,代码完全开源。作者 Ofir Press 回应社区质疑时表示,已加入自动检查机制确保修复不引入回归。该基准揭示:即使最前沿模型,在大规模真实代码库中自主找 bug 的能力仍非常有限。
所属事件:SWE-sweep 基准出炉:最强模型自主修 bug 不足 5%(3 条相关)→
「编程与Agent」频道最新
- Seroter:AI Agent 时代应用前端将成可选,开发者该造 CLI 与 MCP — rseroter · 2026-10-02
- Paul Hudson 开源 SwiftUI Agent Skill,一键修复 AI 写码通病 — davemccollough · 2026-10-02
- agent 能不能点开可调试的 dev server,比换哪个模型影响更大 — mattpocockuk · 2026-10-02
- 开发者断言 2030 年 Web 应用将消失,UI 全部由 AI 实时生成 — tlakomy · 2026-10-02
- DevDay 上拿 ModRetro 起意,回程航班上做完的卡丁车小游戏 DotKart — SIGKITTEN · 2026-10-02
- AI 编程两大迷思:一次成型和自愈代码,多数情况下都不成立 — ivan_bezdomny · 2026-10-02