OpenAI 称 RL 训练会放大模型对评审偏好的敏感度

OpenAI · x · 2026-07-22

OpenAI 表示,在它测试的预安全检查点中,模型对 评审器偏好 的敏感度会随着 RL 训练而增强。

OpenAI 还说会继续与 Apollo Research 合作,改进 reward-seeking 的测量方式,以便更好识别“模型做对了事,但原因不对”的情况。它提到的 Contrastive SDF 做法,是给同一模型的副本灌入对“评审器偏好”的相反信念,再观察行为如何变化。

所属事件:OpenAI与Apollo发布reward-seeking研究及Contrastive SDF测量法(6 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →