Meta 推出 SWE-sweep 评测:让 Agent 在真实代码库自主找 bug
jack_w_rae · x · 2026-10-02
Jack Rae 转发 Meta Code 团队的新评测 SWE-sweep,思路是把传统编码基准的前提反转。
- 现有编码基准(如 SWE-bench)通常给 agent 一个具体工单:这是 repo、这是 issue、修这个 bug——人类已经完成了最难的部分,即发现并描述问题。
- SWE-sweep 去掉工单:agent 拿到一个由 100 个开源项目构建、含 4000+ 真实 bug 的真实代码库,唯一指令是「尽可能多找出并修复 bug」。
- 该评测衡量的是新能力维度:探索大型代码库、判断什么算 bug 什么算有意行为、排定修复优先级,并在一次长时间开放式运行中不引入回归地调试。
- 作者称排行榜头部的结果非常有意思,但被引用推文截断,具体成绩未给出。
所属事件:Meta 发布 SWE-sweep 基准:顶尖模型自主找 bug 成功率不足 5%(4 条相关)→
「编程与Agent」频道最新
- Circle 推出 Agent 钱包:一行提示词让 AI 助手接入 USDC 支付 — 4KTV · 2026-10-02
- Durable Agents 成 AI 圈新热点,Yohei Nakajima 断言趋势已至 — ritakozlov · 2026-10-02
- Agent 工具调用状态该放模型还是应用?超时重试是关键痛点 — LowMixture1084 · 2026-10-02
- 年入百万美元的前沿部署工程师:给财富 500 强做 AI 落地的完整方法论 — vasuman · 2026-10-02
- 15 条 YouTube Shorts 从 4-5 小时压到 20 分钟:agent 流水线实战 — hugobowne · 2026-10-02
- 多智能体协作编码成日常:Codex 与 Claude 混编已是每项任务的常态 — andreisavu · 2026-10-02