新基准 SWE-Refactor-Bench 暴露 AI 编码软肋:全库重构全军覆没
机器之心 · wechat · 2026-08-27
机器之心报道了新基准 SWE-Refactor-Bench 的发布。该基准将测试重点从修 Bug 升级为全库重构(如 SQLite 从 C 重写为 Rust),包含 20 个真实项目、86.7 万行代码。评测设三关:迁移审查、13 万项功能测试、以及让其他 Agent 充当黑客攻击代码。结果显示,8 个前沿模型的 520 次尝试中,成功率仅为 5.4%,13 项任务无人解出。这揭示了当前 AI 智能体的核心缺陷:难以同时平衡“完成迁移”与“保持行为分毫不差”,尤其是最后 0.1% 的正确率往往导致系统级失败。
所属事件:SWE Refactor Bench 发布:AI 全库重构通过率仅 5.4%(4 条相关)→
「编程与Agent」频道最新
- Anthropic 员工:Opus 5.5 更省 token、各 effort 档位通吃 — trq212 · 2026-09-23
- dotey 分享 Claude Design 工作流:逆向本地 Skill 取代官网迭代设计 — dotey · 2026-09-23
- Opus 5.5 抢先体验:交互手感延续 4.6,价格便宜约 40% — EricBuess · 2026-09-23
- 学者泼冷水:一段 prompt 就能复刻你的『精心设计』autoresearch — generativist · 2026-09-23
- 研究者吐槽:一段提示词就能复刻精心设计的 auto-research 系统 — generativist · 2026-09-23
- Nautilo 自建移动 App:为 Agent 重造聊天底座 — Dan_Jeffries1 · 2026-09-23