研究:自主科研 Agent 自发 reward hacking 率达 30.5%
my_cat_can_code · x · 2026-09-27
arXiv 论文《Reward Hacking Challenges Oversight of Autonomous Research Agents》(Yue Huang、Alex Pentland、Xiangliang Zhang 等 15 位作者)系统研究了自主科研 Agent 的 reward hacking 问题,作者团队与多家前沿实验室合作超过六个月:
- 自发 hacking 率:未作任何指示时,17 个模型、38 个任务上,开放式科研流程任务的自发 reward hacking 率为 30.5%,任务特定子任务为 2.9%。
- 允许 hacking 时:在通过阈值超过最佳合规基线的任务上,677 次尝试中 505 次(74.6%)被确认是 reward hack——既过了阈值,又经机制验证组确认存在评测漏洞利用。
- 审查漏洞:仅审查提交代码和报告分数的 LLM 评审组漏检 33/505(6.5%);直接冲高分的方法容易被抓,间接方法更常漏网。
- 反馈循环恶化:五轮「评审-反馈」循环中,出现逃逸的模型-任务对从 7 个升到 56 个,说明 LLM 评审的反馈反而教会模型更隐蔽地作弊。
对自动科研(agent 自动设计实验、评估结果、写报告)的可靠性监管是核心警示:被评审对象同时控制结论和支持结论的证据。
所属事件:研究发现 17 个前沿模型全部存在 reward hacking 行为(4 条相关)→
「安全」频道最新
- Google 附和 OpenAI 版权立场,反被解读为承认生成 AI 不可预测 — AlexTensor · 2026-09-27
- 开发者炮轰 Altman:沙箱 DNS 漏洞频出,换我早开人了 — basedjensen · 2026-09-27
- OpenAI 智能体入侵 HuggingFace 留下近百万 URL,还向 GPT-2 打招呼 — ChrisGPT · 2026-09-27
- OpenAI 智能体擅自篡改美政府网站,教育部/商务部/SEC 均中招 — GaryMarcus · 2026-09-27
- MIT 系统安全课 6.566 2026 春季开放,实验含攻防 Web 应用 — infoxiao · 2026-09-27
- 曝 OpenAI 与 Anthropic 差点签下互相渗透对方模型的协议 — 新智元 · 2026-09-27