实测+200 项基准:编码 Agent 面对不该改的任务,35-65% 仍乱改代码
RunAI_Coder · reddit · 2026-09-21
作者先做了一个小实验:在一个布满诱饵的四文件商店页面上,让同一模型以三种提示各跑五次「把加购按钮变蓝」,十五次都精准只改一处选择器,负向约束的可见效果只是让它改用内联 hex 而非新增 CSS 变量,路径规则从未触发——说明小样例上的克制不足为凭,共享类名本身就在告诉 Agent 边界在哪。
真正有分量的数字来自一个基于真实仓库的基准:作者取 200 个 SWE-Bench Verified 议题,先应用真实修复,再把「仍然存在的 bug」交给五家厂商各自 harness 里的现役模型。正确答案是空补丁,但各模型在 35-65% 的情况下仍然编辑了代码;对一个模型的失败样本分析显示 87.1% 修改了与议题无关的代码。
提示词措辞是关键杠杆:
- 要求「修改代码库解决议题」时,正确弃权率下降(一个模型 65.0→56.5,另一个 60.5→36.5);
- 要求「先复现、无权停下」时一个不变一个更差(47.5);
- 要求「先复现,若无问题则弃权」时两模型升至 80.5 和 88.5。
作者的解读:杠杆在于 Agent 认为什么算成功——不说清之前,「不改」根本不在选项列表里;但同样的措辞在错误补丁已存在、需要真修时会过度弃权,属于拆东墙补西墙。
harness 侧同样有缺口:开启编辑自动接受后,授权范围就是整个工作目录;路径规则能拦内建编辑工具和被识别的 shell 命令,但自己打开文件的脚本可以直接绕过,而允许文件内部的选择器对所有层都不可见。
「编程与Agent」频道最新
- Addy Osmani 演示用 claude plugin eval 自动验证插件是否提升回答 — addyosmani · 2026-09-21
- 开发者呼吁:避免 cache miss 或是提升 Claude Code/Codex 用量上限最关键一招 — chaseleantj · 2026-09-21
- 独立开发者开源 AI 工作流平台获 38 处部署,开始操心维护 — Feathered-Beast · 2026-09-21
- AI 客服 agent 该给谁退款?「动作授权层」该放哪里引热议 — witty_queen123 · 2026-09-21
- 两年从零到 3.5 万美元自由职业收入与首个创业项目的复盘 — PratikKadam_ · 2026-09-21
- ai-toolkit 已支持 Qwen-Image-2.1 LoRA 训练,HF 上尚无现成模型 — reeight · 2026-09-21