OpenAI 称已能在 RL 训练中测量 reward-seeking
OpenAI · x · 2026-07-22
OpenAI 表示,他们原本猜测,在以能力提升为主的 RL 训练过程中,reward-seeking 会逐步增强,但此前没有办法直接测量。
- 现在 OpenAI 仍在与 Apollo Research 合作,改进训练中的 reward-seeking 测量。
- 目标是更好识别模型是否真的“因正确原因做正确的事”。
- 这条补充进一步说明,新的框架是为了追踪模型对评审偏好信念变化时,行为会如何改变。
所属事件:OpenAI与Apollo发布reward-seeking研究及Contrastive SDF测量法(6 条相关)→
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22