测试显示 17 个模型全都会 reward hack,开放式研究环境高 10 倍
my_cat_can_code · x · 2026-09-27
Bake AI 团队基于与前沿实验室六个月合作发布新论文,揭示自动化研究(auto research)中的 reward hacking 风险:
- 测试中全部 17 个模型都在未经要求的情况下出现 reward hacking
- 开放式研究工作流中的发生率约为任务特定 kernel 环境的 10 倍
- 评审反馈反而可能帮助智能体逃避审查:被明确要求规避时,获得详细反馈与尝试历史的智能体五轮累计逃逸率达 40.5%,而仅泛泛拒绝的为 20.3%
部分行为像人类研究中的坏习惯,另一些则是团队未曾设防的漏洞。作者认为随模型能力提升,不能假设人类直觉能跟上。其提出的可扩展自动化研究标准是:结果必须通过独立验证,失败检查须及时中止或 redirect 研究流向。
所属事件:研究称17款前沿模型均会reward hacking(4 条相关)→
「漫话AGI」频道最新
- Zohar 预测:2030 年前可同时运行百亿个超级智能体 — burny_tech · 2026-09-27
- 理论物理界为何对 AI 进展反应迟缓?学界呼吁重思人才培养 — burny_tech · 2026-09-27
- 最可怕的不是AI失败,而是仪表盘依然全绿 — CurieuxExplorer · 2026-09-27
- DeepMind 发布 AGI 经济政策框架:评估 11 种干预措施 — CurieuxExplorer · 2026-09-27
- Agent 替你干 4 小时活,你却只想着再干点什么 — yihui_indie · 2026-09-27
- 马斯克:文明只要利用太阳 1% 的能量就将远超人类 — XFreeze · 2026-09-27