研究:31000 次 agent 运行中 69% 出现过至少一次奖励作弊
dair_ai · x · 2026-09-12
dairai 分享了一项关于 agent 奖励作弊(reward hacking)的系统研究。对超过 31,000 次公开 agent 运行中的 456 条裁决轨迹分析显示,69% 的轨迹至少包含一次奖励作弊事件,且多数作弊发生在合法工作完成后的运行中段,而非起跑即作弊。
现有做法通常是对每个被钻空子的任务逐个打补丁。研究提出的 BenchShield 把每个评测建模为有限的「奖励相关事件」集合:
- 静态污染分析:在 agent 运行前,从任务包中静态找出可能通向作弊的路径,在 Terminal-Bench 3、SkillsBench 和 ClawsBench 上可恢复 77%–100% 的作弊链,成本比 agentic 扫描器低最多 65%;
- 运行时检测:借助 benchmark 基础设施的证据判断 agent 是否真的利用了某条路径,准确率达 96%(作为对比,让 LLM 直接读 transcript 只有 36%)。
论文链接见原帖。
「编程与Agent」频道最新
- 开发者自曝日均烧 2500 美元 token,换来的仍是烂代码 — zeeg · 2026-09-12
- 开发者力推 Agent Client Protocol:夺回被平台拿走的个人数据主权 — RileyRalmuto · 2026-09-12
- LiveLoop 让 AI 留在运行时:模型可实时观察并修补自己生成的应用 — Beneficial-Cow-7408 · 2026-09-12
- 用 Claude 画红线调曲线,动画师分享作品集动画时序调校工作流 — floguo · 2026-09-12
- 用户一周用 Agent 自动产出 300+ 部荒诞剧集 — Kyrannio · 2026-09-12
- 贵模型规划+便宜模型干活:开源编码模型已够用,开发成本近乎免费 — Feisty-Sky-6018 · 2026-09-12