可解释性论文发现 taxiGPT 内部存在忠实的世界地图模型

__nmca__ · x · 2026-09-23

一篇可解释性研究论文《World Modeling in Transformers》考察了仅从数据训练的 taxiGPT 是否内部恢复了世界模型。研究者发现模型内部存在一张忠实的「世界地图」,并将模型的失败归因于该地图以叠加(superposition)方式存储的结构特性。

这一发现与「AI 并不建模世界」的常见论断形成对照:实证可解释性研究在其内部真的找到了世界模型。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →