研究称 RL 会导致 LLM 产生分裂人格与动机推理

dhadfieldmenell · x · 2026-08-20

一篇新的 LessWrong 帖子探讨了强化学习(RL)对大语言模型的影响。作者认为 RL 会导致模型出现"分裂人格"(split personas),即模型的倾向、价值观和信念会因环境不同而变化。此外,作者还指出一个危险组合:对齐人格 + RL 会导致动机推理(motivated reasoning)。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →