WideSWE 基准:编程智能体跨仓库协作,最强配置成功率仅 42.5%
Baoyi Wang · hf · 2026-09-29
浙大团队发布 WideSWE,首个评估编程智能体跨仓库协同改动的基准。现有评测多局限于单一代码库,而真实软件生态中许多功能和修复需要同时改动多个仓库。
- 从 103 个软件生态中挖掘并审查出 120 个真实任务(60 个 bug 修复 + 60 个功能),prompt 由相关 issue 和 PR 派生,隐藏测试经过系统审查以兼容多种正确实现
- 7 种 agent 配置的完整任务成功率仅 10.83%42.50%,最高为 Codex CLI + GPT-5.6-sol
- 轨迹分析显示三类失败:漏识别必要改动、识别了但未完成、改了仓库但不完全满足要求
- 对比实验:逐仓库独立执行主要能补回遗漏工作,对纠正已尝试但失败的实现效果差;联合执行可利用关联仓库信息指导实现与验证
代码开源于 GitHub(ZJU-ACES-ISE/WideSWE)。
「编程与Agent」频道最新
- Qwen 团队开源 QwenGyre:超长程 Agent 在线 RL 训练框架 — Qwen · 2026-09-29
- 梗图:用户威逼利诱 agent 执行自己的「烂计划」 — mike64_t · 2026-09-29
- Agent 记忆该有保质期:作者提出六字段记忆元数据框架 — Hairy-Difficulty-411 · 2026-09-29
- 开发者搭桥:网页版 ChatGPT 通过远程 MCP 直接操作本地电脑 — ChoasMaster777 · 2026-09-29
- 99 秒演示:用 MCP 给 Agent 加终端+浏览器受控执行与审批边界 — ImaginaryMachine9110 · 2026-09-29
- SolarMind 亮相:带持久记忆的 AI 事故响应 Agent 四级自动分诊 — CountyNecessary4030 · 2026-09-29