论文:Transformer 并非没有世界模型,而是特征叠加互相干扰
burny_tech · x · 2026-09-23
arXiv 论文《World Modeling in Transformers》用 TaxiGPT(在曼哈顿随机游走数据上训练的 Transformer)回应了「Transformer 学不到连贯世界模型」的质疑。
- 通过机制分析与因果干预,作者发现模型其实内部表示了路口和街道、能追踪自身位置,并用一个「目标罗盘」导航
- 其失败根源是叠加路口特征之间的干扰,破坏了内部地图中的定位,而非地图本身不连贯
- 提出 affordance packing(把合法走法相同的路口表示分组)可限制这类错误的影响
- 给出可用于跨模型比较的机制性指标,发现世界建模能力在训练不同阶段先后涌现
结论:研究范式应从「模型有没有世界模型」转向机制性地研究它如何表征环境并据此行动。
所属事件:研究发现 Transformer 内部存在忠实的世界模型(2 条相关)→
「研究」频道最新
- Gemini 训练细节曝光:组级奖励重分配对抗 reward hacking — nrehiew_ · 2026-09-23
- 新模型架构极简:SWA+无共享专家 MoE,与 DeepSeek 路线迥异 — nrehiew_ · 2026-09-23
- 研究发现被训练否认内心体验的模型更爱用「面具」隐喻 — cephaloform · 2026-09-23
- Geodesic 开放 API:自研 NovaAtom 分子结构预测模型首次对外提供 — QuanquanGu · 2026-09-23
- EPFL 量子 CNN 仅用 10 个样本学会识别数字,同级经典 CNN 仍是随机水平 — PlisSergey · 2026-09-23
- 新论文 PFD 统一解释 SDS 模式坍缩,蒸馏收敛更快方差更低 — burny_tech · 2026-09-23