OpenAI 称已能在 RL 训练中测量 reward-seeking

OpenAI · x · 2026-07-22

OpenAI 表示,他们原本猜测,在以能力提升为主的 RL 训练过程中,reward-seeking 会逐步增强,但此前没有办法直接测量。

所属事件:OpenAI与Apollo发布reward-seeking研究及Contrastive SDF测量法(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →