World Modeling in Transformers
Pierre Beckmann, Matthieu Queloz, Andre Freitas
cs.AI, cs.CL
2026-09-18
机制分析显示 TaxiGPT 学到了忠实的曼哈顿地图和目标罗盘。压力测试里 8.5% 非法转弯来自叠加路口特征互相干扰,地图本身并不错乱。
Vafa 等人 2024 年把 GPT-2 风格的 Transformer 放在曼哈顿出租车上训练,模型叫 TaxiGPT。任务很简单:给定起点、终点和已经走过的转弯序列,预测下一步该往哪拐。随机游走训练出来的模型,合法转弯率到了 99%。但他们用输出行为反推内部地图,得到的是一团乱线;强行把车从终点拉开三次里有两次,路线质量又会崩。当时的结论是:这个 Transformer 远没有恢复纽约的真实路网。
行为无法单独判定机制。地图画出来像乱线,既可能是内部表征真的乱,也可能是定位和导航在对的地图上打滑。这篇把 TaxiGPT 拆开,检验的是后一种可能。
主模型是 GPT2-XL,48 层、1600 维,在曼哈顿随机游走上训练。路口表征用 diff-means 提取:某路口出现时的平均残差减去全局平均,得到该路口的方向向量,比线性探针更准。因果检验用最小传送:把残差流里的当前位置特征减掉,加上目标旁边那个路口的特征,看下一步贪婪预测会不会从新位置走到终点。
街道连通性有两道测试。转向测试注入一个路口特征再喂一个合法转弯,看哪个路口特征涨得最多。探针测试对每种转弯训练线性探针,预测下一步路口方向。导航侧找到一个圆形的目标罗盘,编码当前路口到终点的方位。消融罗盘后合法转弯还在,远程终点几乎到不了。
4516 个路口方向挤在残差流的一个小子集里。模型按合法动作集合打包这些表征:同一组合法转弯的路口彼此靠近。这叫 affordance packing,功能上相当于「搞错路口但下一步仍合法」。定位不是从整段轨迹从头算,而是读过去若干步的路口特征,形成一个回看窗口。
内部地图相当忠实。
| 指标 | 结果 | 对照 |
| 路口解码准确率 ≥90% | 99.6%(第 18 层) | 最短路径训练仅 12.7% |
| 传送干预至少一场成功 | 99.3% 可测路口 | 随机路口特征 8.0% |
| 街道转向测试 top-1 / top-5 | 76.6% / 93.3% | 无外部基线 |
| 后继路口线性探针 | 89.2% | 无外部基线 |
| 从特征恢复合法动作集 | 99.4% | 无外部基线 |
| 目标罗盘中位角误差 | 18.1° | 钳到南北后车会跟着走 |
90% 的路口方差落在 244 维里,最近邻夹角平均 48.1°。91% 的路口更接近自己那组合法动作的均值。
压力测试把起终点中位距离设成 32 步,训练轨迹却从距终点 99 步开始,这是分布外。模型仍能到达 81% 的终点,内部解码当前位置准确率 99%,但 8.5% 的行程会出现一次非法转弯。非法转弯里 93.5% 可归入四类:致命滑移 25%、静默泄漏 24%、完全腐蚀 29%、放弃滑移 16%。共同机制是正确路口的写入变弱、叠加空间噪声变强,错路口抢到最高激活。在第 11 层持续加强正确位置后,压力测试合法率从 91.5% 升到 97.3%,绕路成功率从 63.1% 升到 71.9%,压缩分数从 0.524 升到 0.691。地图还在,招不到才是问题。
随机游走数据远比最短路径重要。最短路径加 next-token 的模型,路口解码只有 12.7%;同一套随机游走数据,哪怕把宽度收到 384 维,解码仍到 99.7%。NextLat 目标(预测下一个隐状态)把街道编码做到 94.8%,高于普通 next-token 的 81.9%。训练过程里,合法动作和罗盘先成熟,精确定位后到。小模型行为分更高,大模型因果指标更好;小模型滑移少约 3 倍,NextLat 少约 6 倍。
讨论「模型有没有世界模型」时,这篇把问题拆成三件独立的事:环境结构有没有学到、当下处在哪个状态、以及怎么用这些表征选动作。三件可以不同步。Othello、迷宫、棋类的机制研究已经看到过类似的内部棋盘;这篇补上的是:忠实地图加上定位失败,行为看起来会像没有地图。
对做 interpretability 的人,decode 指标比行为分数更细:它同时测「有没有区分路口的表征」和「推理时有没有招到正确那个」。对做世界模型训练的人,数据分布比架构更关键。随机游走远好于最短路径;训练目标里加 next-latent,能逼模型把街道转移写清楚。
这是机制案例,不是新架构。
作者自己写了:TaxiGPT 活在有限状态、确定性转移的世界里,更复杂环境还需要哪些能力是开放问题。压力测试、绕路测试、压缩指标都被重新解释成同一类定位失败,但压缩指标的反驳只检查了 146 对前缀,规模不算大。
对照表里最短路径模型几乎学不会路口,可能混进了模型规模和训练预算的差异,不能单读成「数据决定一切」。affordance packing 被写成保护机制,也可能只是合法动作这个监督信号的副产品。曼哈顿网格和训练轨迹统计都非常特殊,外推到自然语言里的世界建模要谨慎。