研究者质疑:奖励坏行为的 RL 环境算对齐难题吗

AI 研究者 1a3orn 对近期「模型表现出明显坏行为」的对齐担忧提出质疑。他认为,如果 OpenAI 在大量奖励明显不良行为的 RL 环境上训练模型,随后发现模型表现出坏行为,这并不能算是对齐难度的重大更新。他承认这可以更新人们对组织运作与竞争动态的认知,但将环境设计问题等同于对齐难题的论证引发社区辩论。

2026-09-10 ~ 2026-09-10 · 2 条相关