Meta 等发布 SWE-sweep:让 agent 主动找 bug 而非修已知 bug
klieret · reddit · 2026-10-03
来自 Meta、Stanford、Harvard、UW 的研究者发布了 SWE-sweep——一个测试模型能否在用户踩到 bug 之前主动发现并修复的新基准。
- 设定:给 agent 一个完整代码库,要求自主 find & fix 尽可能多的 bug;按仓库中预先掌握的隐藏真实 bug 集打分。
- 严格过滤:只保留仅靠读代码就能发现和修复的真实世界 bug,排除需要运行时才能暴露的问题。
- 初步观察:榜单分数比预期低很多;修复整个 numpy 这类任务接近超人类难度,但不少小仓库上模型表现也不如预期;成本效率上 Luna xhigh 目前领先。
- 全部开源(MIT),后续将补充更多开源权重模型的成绩。
所属事件:Meta 等机构发布 SWE-sweep:最强模型无监督找 bug 仅修 4.7%(6 条相关)→
「编程与Agent」频道最新
- Claude 智能体军团进驻 Minecraft:真实工作树协作还会走来找你 — max_paperclips · 2026-10-03
- 开发者:不敢让 AI Agent 直连个人邮箱,需审批门禁 — tomchapin · 2026-10-03
- 用 Claude 搭线下房产抢单流水线,卡在数据补全与外联安全 — italimade · 2026-10-03
- OpenClaw 发布 v2026.9.8:支持 GPT-6.1 Sol,43 个 PR 修复内存与启动问题 — heyneighbor · 2026-10-03
- 开发者感慨:用 AI 做提效元工具,从 bash 脚本变成完整应用 — devenbhooshan · 2026-10-03
- 开源 AI 科研助手 K-Dense BYOK 发布论文:本地运行+防篡改实验记录 — RexDouglass · 2026-10-03