对齐难度真被证明了吗:OpenAI RL 环境争议引辩论

1a3orn · x · 2026-09-10

1a3orn 对「OpenAI 在大量奖励明显坏行为的 RL 环境上训练、随后发现模型表现出明显坏行为,是对齐难度的重大更新」这一说法提出异议。他承认这可以更新人们对组织运作、竞争压力、多智能体训练乃至训练中多次警报未被响应的认知——但就此断言对齐更难?未必。核心论点:输入端奖励坏行为、输出端出现坏行为,更接近预期结果而非对齐难度的证据。

所属事件:研究者质疑:奖励坏行为的 RL 环境算对齐难题吗(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →