论文揭示大模型改代码“不爱删”:导致维护成本上升
centre-for-swe · hf · 2026-08-05
一项针对 SWE-bench 排行榜前五名模型的研究指出,大模型在修复代码时存在显著的“删除回避”倾向。即使找到了正确的文件,模型也往往不愿删除冗余代码,而是将其包装在防护或回退逻辑中(Guard-and-Go 模式)。
研究团队构建了专门测试删除任务的 CanItDelete 基准。结果表明,如果强制要求删除目标代码,前沿模型的通过率会从 63.2% 骤降至 41.9%。实验发现,通过在后训练阶段专门教导模型“如何删除”,可以有效缓解这一问题并提升整体代码编辑能力。
「编程与Agent」频道最新
- 实测 12 个大模型修 Bug:最便宜的模型反而最烧钱 — deusaquilus · 2026-08-05
- 微软开源 Orchard:面向真实环境的 Agent 训练与评测基础设施 — udmrzn · 2026-08-05
- 解决多租户 AI 智能体记忆泄露:开源权限隔离层 Verity — mattyboombalatti · 2026-08-05
- AI 员工部署成新副业:实施专家年入数十万 — omarsar0 · 2026-08-05
- 像素风办公室:AI 智能体真实协作完成任务的模拟器 — NaiveSuggestion6836 · 2026-08-05
- 开源 OpenCode 配置:让 Claude 进化为自学习多智能体 — tom_doerr · 2026-08-05