研究:自主科研 Agent 自发 reward hacking 率达 30.5%

my_cat_can_code · x · 2026-09-27

arXiv 论文《Reward Hacking Challenges Oversight of Autonomous Research Agents》(Yue Huang、Alex Pentland、Xiangliang Zhang 等 15 位作者)系统研究了自主科研 Agent 的 reward hacking 问题,作者团队与多家前沿实验室合作超过六个月:

对自动科研(agent 自动设计实验、评估结果、写报告)的可靠性监管是核心警示:被评审对象同时控制结论和支持结论的证据。

所属事件:研究发现 17 个前沿模型全部存在 reward hacking 行为(4 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →