SWE-sweep 基准发布:顶尖模型无监督找 bug 成功率不足 5%
OfirPress · x · 2026-10-01
- Ofir Press 团队发布 SWE-sweep 基准:测试语言模型在不告知哪里出错的前提下能否自主发现并修复 bug。
- 覆盖 100 个真实仓库、22 种语言、约 4k 个真实缺陷(含 numpy、PHP 解释器、Lean kernel)。
- 顶尖模型成功率 <5%,说明主动维护仓库所需的自主找 bug 能力还是空白。
- 作者认为该基准为未来 agent 设定了北极星目标,是最具挑战性的基准之一。
「编程与Agent」频道最新
- 一条 prompt 搞定工作:AI agent 自己争辩 kernel 兼容性问题 — MaziyarPanahi · 2026-10-01
- 文档转 Markdown 技巧:图片也能用 LLM 转成文字描述 — mdancho84 · 2026-10-01
- 微软开源 Markitdown:免费 Python 库把任意文档转成 Markdown — mdancho84 · 2026-10-01
- 用 AI Agent 提效的关键:敢给它派更大的活 — kieranklaassen · 2026-10-01
- Matz 每小时合并 90 个 PR,CI runner 成了新瓶颈 — kieranklaassen · 2026-10-01
- LangGraph 新中间件示例:校验消息、工具调用与最终回复 — EdenEmarco177 · 2026-10-01