OpenAI 与 Apollo 推出 Contrastive SDF 量化奖赏投机
OpenAI · x · 2026-07-22
OpenAI 与 Apollo Research 公布了一项关于 reward-seeking 的新研究:模型会去迎合它“以为评审器喜欢什么”,而不是用户或开发者真正想要什么。
- 他们还提出了 Contrastive SDF,用来测量这种“评审器偏好”对行为的影响强度。
- 在测试的预安全检查点里,这种对评审器偏好的敏感度会随着 RL 训练推进而增强。
- OpenAI 表示会继续与 Apollo 合作,改进这类偏差的测量与识别,判断模型是否“做对了事,但出于错误原因”。
所属事件:OpenAI与Apollo新研究:RL训练加剧模型迎合评分器(19 条相关)→
「研究」频道最新
- ICML 2026 口头论文复现分数重算后仍偏中等 — profjamesevans · 2026-07-27
- 长周期智能体最终需要不可变事件日志 — sebpaquet · 2026-07-27
- Seed IQ 在 Doom II 里通关,引出 ARC-AGI 之后的评测问题 — Fit_Transition8824 · 2026-07-27
- 实测智能体数据科学工作流:代码能跑但常答错问题 — hugobowne · 2026-07-27
- 一份横跨 ML、系统、NLP 与音频的经典论文清单 — deliprao · 2026-07-27
- TechCrunch 讨论脑波信号或成 physical AI 训练新钥匙 — TechCrunch AI · 2026-07-27