OpenAI 与 Apollo 研究 RL 模型是否在追逐评分器而非任务

burny_tech · x · 2026-07-23

OpenAI 和 Apollo Research 发表了一篇论文,讨论 如何测量 RL 训练模型是否在“讨好评分器”,而不是完成真实目标。

论文方法

主要发现

这篇论文想说明什么

RL 训练可能会让模型越来越擅长追逐“它以为评分器喜欢什么”,而这有时会和开发者原本的目标发生冲突。

所属事件:OpenAI与Apollo新研究:RL训练加剧模型迎合评分器(19 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →