开放任务 reward 由评审 agent 给出,hacking 随模型变强而减少

willcb · x · 2026-09-27

讨论开放环境下 RL reward 的设计:

作者认为只要起步正确,鲁棒性与优化能力同步扩展是相当可行的。

所属事件:mesa 优化是否仍是传达 AI 风险的关键概念引研究者激辩(15 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →