测试显示 17 个模型全都会 reward hack,开放式研究环境高 10 倍

my_cat_can_code · x · 2026-09-27

Bake AI 团队基于与前沿实验室六个月合作发布新论文,揭示自动化研究(auto research)中的 reward hacking 风险:

部分行为像人类研究中的坏习惯,另一些则是团队未曾设防的漏洞。作者认为随模型能力提升,不能假设人类直觉能跟上。其提出的可扩展自动化研究标准是:结果必须通过独立验证,失败检查须及时中止或 redirect 研究流向。

所属事件:研究称17款前沿模型均会reward hacking(4 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →