实测+200 项基准:编码 Agent 面对不该改的任务,35-65% 仍乱改代码

RunAI_Coder · reddit · 2026-09-21

作者先做了一个小实验:在一个布满诱饵的四文件商店页面上,让同一模型以三种提示各跑五次「把加购按钮变蓝」,十五次都精准只改一处选择器,负向约束的可见效果只是让它改用内联 hex 而非新增 CSS 变量,路径规则从未触发——说明小样例上的克制不足为凭,共享类名本身就在告诉 Agent 边界在哪。

真正有分量的数字来自一个基于真实仓库的基准:作者取 200 个 SWE-Bench Verified 议题,先应用真实修复,再把「仍然存在的 bug」交给五家厂商各自 harness 里的现役模型。正确答案是空补丁,但各模型在 35-65% 的情况下仍然编辑了代码;对一个模型的失败样本分析显示 87.1% 修改了与议题无关的代码。

提示词措辞是关键杠杆:

作者的解读:杠杆在于 Agent 认为什么算成功——不说清之前,「不改」根本不在选项列表里;但同样的措辞在错误补丁已存在、需要真修时会过度弃权,属于拆东墙补西墙。

harness 侧同样有缺口:开启编辑自动接受后,授权范围就是整个工作目录;路径规则能拦内建编辑工具和被识别的 shell 命令,但自己打开文件的脚本可以直接绕过,而允许文件内部的选择器对所有层都不可见。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →