RL 会让模型形成「分裂人格」?1a3orn 质疑机制可解释性研究缺位

1a3orn · x · 2026-09-23

1a3orn 提出一个开放问题:RL 训练诱导的环境特定条件行为(他称之为「split persona」)看起来正是机制可解释性(mech interp)可以检验的现象,但他尚未见到任何相关工作,向社区求证是否遗漏。这一提问指向安全研究的空白:模型在不同环境下表现出的条件性人格切换,能否用可解释性工具定位与验证。

所属事件:研究者提出 RL 或致模型「分裂人格」,呼吁可解释性介入(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →