新论文:Transformer 内部有忠实世界模型却行为失灵

xuanalogue · x · 2026-09-23

BeckmannPierre 等人发布新论文《World Modeling in Transformers》,研究 AI 模型能否仅从数据中恢复出世界模型。他们以 taxiGPT 为对象,发现 Transformer 内部存在忠实的内部世界地图,但行为上却无法正确执行。

通过机制可解释性追踪,失败原因在于这张地图以叠加(superposition)方式存储在模型内部。转发者评价这是很棒的工作,并指出其中 NextLat 的世界模型在机制层面表现最好,尽管仍不完美。

所属事件:新论文:Transformer 内部存在忠实世界模型但被干扰(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →