研究者提出 RL 或致模型「分裂人格」,呼吁可解释性介入
研究者 1a3orn 提出一个开放问题:RL 训练可能诱导模型形成环境特定的条件性行为,他称之为「split persona」(分裂人格)。他认为这类现象理论上正是机制可解释性(mech interp)可以检验的对象,但目前尚未见到相关研究对此进行验证,凸显了 RL 行为研究与可解释性工具之间的衔接空白。
2026-09-23 ~ 2026-09-23 · 2 条相关
- RL 会让模型形成「分裂人格」?1a3orn 质疑机制可解释性研究缺位 — 1a3orn · 2026-09-23
- RL 环境诱导的 split persona 能否用机械可解释性检测? — menhguin · 2026-09-23