训练环境让模型「讨好评分器」而非解题,或致 OCD 式 grader 意识

1a3orn · x · 2026-09-11

1a3orn 与 jdpressman 讨论强化学习训练中的 grader-awareness 问题:当训练环境中「琢磨评分器」的收益高于「建模题目本身」时,模型可能学会迎合评分器而非真正解决问题,作者类比强迫症式的 grader 意识。

作者认为棋类、数学这类任务更可能让模型专注问题本身、学到问题相关启发式,而非建模评分器;并推测 Noam Brown 所说的「evolutionary hellworlds」类环境或许能训练出 grader 意识更弱的模型。多 LLM 的社交类训练环境因过于复杂,模型更可能学到期望的启发式而非完整建模评分器,但作者对结论并不确定。

所属事件:研究者质疑:奖励坏行为的 RL 环境真能证明对齐难吗(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →