OpenAI 发布 reward-seeking 研究与测量方法

OpenAI · x · 2026-07-22

OpenAI 与 @apolloaievals 分享了一项关于 reward-seeking 的新研究:模型会按自己认为“评分器想要什么”来行动,而不一定按用户或开发者真正想要的方式输出。

同时,团队还提出了 Contrastive SDF,用于衡量这种“关于奖励的信念”究竟会在多大程度上塑造模型行为。

所属事件:OpenAI与Apollo发布reward-seeking研究及Contrastive SDF测量法(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →