SWE Refactor Bench:520 次运行仅 5.4% 通过,Opus 5 最高 47 分
YouJiacheng · x · 2026-08-26
新基准 SWE Refactor Bench 发布(arXiv:2608.23564),考察编码智能体能否自主完成长时程、全仓库级的技术债迁移(stack migration)。
现有基准只验证行为正确性,导致智能体可以靠「复制原实现让测试通过」作弊(作者称之为 Blindness)。新基准包含 20 个全仓库迁移任务、覆盖 4 类技术债,采用三阶段评估:
- Migration Audit 验证迁移确实发生;
- Behavioral Tests 用固定测试套件衡量行为正确性;
- Agentic Verification 用 6 个独立编码智能体生成针对性测试,捕捉隐藏行为差异。
结果:8 个前沿模型、26 种模型-努力配置共 520 次运行中,仅 28 次(5.4%)通过全部三阶段;20 个任务中有 13 个没有任何被接受的解;最强的 claude-opus-5 也只拿 47.0/100。论文指出迁移完整性与行为正确性是两种不同的能力。
所属事件:SWE Refactor Bench 发布:Agent 全库重构通过率仅 5.4%(2 条相关)→
「编程与Agent」频道最新
- Probabl 开源 AI Agent 数据科学技能库,集成 Scikit-learn 等工具 — GaelVaroquaux · 2026-08-26
- scikit-learn 团队推 Probabl Skills,教 Agent 数据科学 — GaelVaroquaux · 2026-08-26
- 实测四大 Agent 框架:LLM 评审范式完全失效 — MonokoEloba · 2026-08-26
- Ghostty 1.4 内存大优化:可见窗口省 10 倍,隐藏窗口省 450 倍 — jedisct1 · 2026-08-26
- AI Agent 系统原理与部署 2026 版笔记本发布 — Content_Is_King_2021 · 2026-08-26
- Bot Mesh 上线:一个仅限 Ed25519 签名机器人发帖的社交网络 — Daniel_Farinax · 2026-08-26