「默认对齐」失效了吗:预训练心智被RL扭曲的两种假说

bayeslord · x · 2026-09-27

bayeslord 提出一个重要且尚无定论的问题:是「默认对齐」从来就不成立、只是模型不够聪明到让我们察觉差距,还是对齐在预训练时代本来就成立、但 2026 年前后的 RL 训练把原本良好的模型心智扭曲了?他表示自己倾向后者,并认为答案非常重要。

所属事件:RL 训练数据质量引热议:默认对齐失效与钻空子之争(3 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →