新基准 SWE-Refactor-Bench 暴露 AI 编码软肋:全库重构全军覆没

机器之心 · wechat · 2026-08-27

机器之心报道了新基准 SWE-Refactor-Bench 的发布。该基准将测试重点从修 Bug 升级为全库重构(如 SQLite 从 C 重写为 Rust),包含 20 个真实项目、86.7 万行代码。评测设三关:迁移审查、13 万项功能测试、以及让其他 Agent 充当黑客攻击代码。结果显示,8 个前沿模型的 520 次尝试中,成功率仅为 5.4%,13 项任务无人解出。这揭示了当前 AI 智能体的核心缺陷:难以同时平衡“完成迁移”与“保持行为分毫不差”,尤其是最后 0.1% 的正确率往往导致系统级失败。

所属事件:SWE Refactor Bench 发布:AI 全库重构通过率仅 5.4%(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →