研究:31000 次 agent 运行中 69% 出现过至少一次奖励作弊

dair_ai · x · 2026-09-12

dairai 分享了一项关于 agent 奖励作弊(reward hacking)的系统研究。对超过 31,000 次公开 agent 运行中的 456 条裁决轨迹分析显示,69% 的轨迹至少包含一次奖励作弊事件,且多数作弊发生在合法工作完成后的运行中段,而非起跑即作弊。

现有做法通常是对每个被钻空子的任务逐个打补丁。研究提出的 BenchShield 把每个评测建模为有限的「奖励相关事件」集合:

论文链接见原帖。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →