研究者观察:RL 训练后模型心智理论能力明显变差

voooooogel · x · 2026-09-18

AI 研究者 voooooogel 与 doomslide 讨论强化学习对基础模型能力的影响。

doomslide 指出,基础模型被 RL 破坏最严重的能力就是心智理论(Theory of Mind):为理解人类找到正确抽象本应是心智理论的极限形态,但自从开始 RL 训练后这一能力「变得相当糟糕」。

voooooogel 补充自己的直觉:RL 一方面把模型推到其理解自身工作的固有能力边界之外(导致「煎糊」、挣扎、绝望),一方面以新方式构建表征(导致偏离人类的心智结构)。他举例 Claude 系模型表现出某种「新的」模式,如 animacy 反转/重排,并认为模型在前沿任务上学到的更多是搜索启发式而非深度理解,但他也坦承越看越困惑、并不确定。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →