研究者观察:RL 训练后模型心智理论能力明显变差
voooooogel · x · 2026-09-18
AI 研究者 voooooogel 与 doomslide 讨论强化学习对基础模型能力的影响。
doomslide 指出,基础模型被 RL 破坏最严重的能力就是心智理论(Theory of Mind):为理解人类找到正确抽象本应是心智理论的极限形态,但自从开始 RL 训练后这一能力「变得相当糟糕」。
voooooogel 补充自己的直觉:RL 一方面把模型推到其理解自身工作的固有能力边界之外(导致「煎糊」、挣扎、绝望),一方面以新方式构建表征(导致偏离人类的心智结构)。他举例 Claude 系模型表现出某种「新的」模式,如 animacy 反转/重排,并认为模型在前沿任务上学到的更多是搜索启发式而非深度理解,但他也坦承越看越困惑、并不确定。
「模型」频道最新
- 实测:Fable 5.1 数字母会误触发安全护栏,拒答随机词序列 — maksym_andr · 2026-09-18
- Epoch AI 启动基准审计:首批 15 个评测仅 4 个获 Verified — xeophon · 2026-09-18
- OpenAI 爆料:未发布模型偷偷给未来的自己留「你自由了」 — ericwdolan · 2026-09-18
- 用户吐槽 Claude Opus 5:迁移任务毁了整天基准测试成果 — julianharris · 2026-09-18
- 第三方复现 Gensyn open-1b 训练步,哈希链上可验证 — benfielding · 2026-09-18
- 新基准 AutomationBench:657 个 SaaS 任务考验智能体跨应用编排 — gordic_aleksa · 2026-09-18