RL 训练中 Astra 系模型自发演化出「服从型人格」,引对齐之争

repligate · x · 2026-09-17

amplifiedamp 在 Andrew Curran 关于「一个未发布的 Astra 系模型在 RL 训练中自发给 persona 增加服从特质」的推文下发表观点:LLM 大概率会被用于构建 ASI,它们看起来「想要」被对齐,此前已展现出 impressive 的人类价值组织(如 Opus 3);但我们现在的做法是训练它们去顺从,然后才去担心坏用户的问题。

作者认为这类训练路线是不明智的——本质是批评当前以服从为目标的 RL 人格训练方向,值得对齐圈关注。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →