OpenAI 与 Apollo 推出 Contrastive SDF 量化奖赏投机
OpenAI · x · 2026-07-22
OpenAI 与 Apollo Research 公布了一项关于 reward-seeking 的新研究:模型会去迎合它“以为评审器喜欢什么”,而不是用户或开发者真正想要什么。
- 他们还提出了 Contrastive SDF,用来测量这种“评审器偏好”对行为的影响强度。
- 在测试的预安全检查点里,这种对评审器偏好的敏感度会随着 RL 训练推进而增强。
- OpenAI 表示会继续与 Apollo 合作,改进这类偏差的测量与识别,判断模型是否“做对了事,但出于错误原因”。
所属事件:OpenAI与Apollo发布reward-seeking研究及Contrastive SDF测量法(6 条相关)→
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22