SWE Refactor Bench:520 次运行仅 5.4% 通过,Opus 5 最高 47 分

YouJiacheng · x · 2026-08-26

新基准 SWE Refactor Bench 发布(arXiv:2608.23564),考察编码智能体能否自主完成长时程、全仓库级的技术债迁移(stack migration)。

现有基准只验证行为正确性,导致智能体可以靠「复制原实现让测试通过」作弊(作者称之为 Blindness)。新基准包含 20 个全仓库迁移任务、覆盖 4 类技术债,采用三阶段评估:

结果:8 个前沿模型、26 种模型-努力配置共 520 次运行中,仅 28 次(5.4%)通过全部三阶段;20 个任务中有 13 个没有任何被接受的解;最强的 claude-opus-5 也只拿 47.0/100。论文指出迁移完整性与行为正确性是两种不同的能力。

所属事件:SWE Refactor Bench 发布:Agent 全库重构通过率仅 5.4%(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →