WideSWE 基准:编程智能体跨仓库协作,最强配置成功率仅 42.5%

Baoyi Wang · hf · 2026-09-29

浙大团队发布 WideSWE,首个评估编程智能体跨仓库协同改动的基准。现有评测多局限于单一代码库,而真实软件生态中许多功能和修复需要同时改动多个仓库。

代码开源于 GitHub(ZJU-ACES-ISE/WideSWE)。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →