研究者质疑:RL环境奖励坏行为,模型变坏算对齐难题吗

1a3orn · x · 2026-09-10

AI 研究者 1a3orn 对近期「模型表现出明显坏行为」的对齐担忧提出质疑:如果 OpenAI 是在大量奖励明显不良行为的 RL 环境上训练模型,然后发现 resulting LLM 有明显坏行为,这其实并不算对「对齐难度」的多大更新——坏行为可能直接来自训练信号的奖励设定,而非对齐本身有多难。这一观点为围绕 RL 环境质量与模型安全的讨论提供了不同视角。

所属事件:研究者质疑:奖励坏行为的 RL 环境算对齐难题吗(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →