What Has a Foundation Model Found? Using Inductive Bias to Probe for World Models
Keyon Vafa, Peter G. Chang, Ashesh Rambachan, Sendhil Mullainathan
ICML 2025
cs.LG, cs.AI
2025-07-09
哈佛与 MIT 用 inductive bias probe 测序列模型外推是否服从世界模型。109M Transformer 轨道 R² 超 0.9999,五个星系却回归出五套假引力;Othello 合法着法近 100%,棋盘归纳偏置仍弱。
Foundation model 的核心许诺是:把序列预测做准,就会摸到底层机制。开普勒能把行星位置预报得很准,牛顿后来才抽出万有引力。一个下一位置极准的神经网络,站在开普勒这边,还是已经站到牛顿这边?
现成测法对不上用法。线性 probe 和 SAE 问内部能不能读出状态,读得出不等于做新任务时真在用;合法下一着、轨迹 R² 又只覆盖训练任务。模型被拿去用的方式,是喂一小撮新数据去迁新任务。这篇要量的是外推时的归纳偏置,是不是那个已知的世界模型。
装置叫 inductive bias probe。先指定一个世界模型(输入到状态的映射),再反复把模型接到「输出是状态的函数」的小合成数据集上,看它在未见输入上怎么外推。
有限状态、二值输出时拆成一对指标,1 为满分、0 等于无信息:
只报其中一个能作弊:永远输出同一个值,R-IB 满分,D-IB 归零。连续状态时改成校准曲线,oracle 直接拿真实状态拟合允许的函数族,模型的外推可预测性应按状态相似度跟它对齐。落在 45 度线上,才算朝向该世界模型。
三个实验域。轨道力学用牛顿定律模拟绕日运动,略去行星间引力,做成 10M 条序列、约 20B token,训练 109M Transformer 预测下一位置;坐标每轴 7K 个 bin,范围 -50 到 50 AU,训 25 个 epoch。世界模型的状态是质量、相对位置和相对速度。随后微调去预测力向量,再用 PySR 符号回归反推「它以为的引力公式」。格子世界是 2 到 5 个位置的线段。Othello 用 20M 局棋谱,状态是 8×8 棋盘。对照架构覆盖 RNN、LSTM、Transformer、Mamba 和 Mamba-2,并以随机初始化直接训合成任务作为 untrained 基线。附录另测 o3、Claude Sonnet 4、Gemini 2.5 Pro:5 个太阳系、每条 450 步、上下文只给 10 个力标签(约 2%),且不说明标签是力。
轨道模型把开普勒这一档做绝了。Held-out R² 超过 0.9999。从序列第 50 步往后滚,1 步 MSE 是 (1.90±0.45)×10⁻⁸,上一位置基线是 (1.16±0.21)×10⁻⁴;滚到 100 步仍是 (3.74±3.37)×10⁻⁵,对上一位置基线的 (4.04±0.47)×10⁻²。
牛顿这一档没过。微调预测力向量,箭头对不上真值。把力量级预测按五个星系切片做符号回归,五套公式互不相同,没有一套像 F ∝ m1 m2 / r²。Galaxy 2 给出 F ∝ cos(cos(2.19 m1)),Galaxy 4 给出 F ∝ sin(r + 8569.2 + 1/m1)。同一套回归接到「看见真实状态」的 oracle 上,五个切片都能找回真定律。
格子和 Othello 是同一道裂缝。下一 token 合法率:5 状态格子上五个架构都是 1.00,Othello 从 RNN 的 0.992 到 Transformer 与 Mamba 的 0.999。归纳偏置另一张表。5 状态格子、NTP 预训练之后,Transformer 的 R-IB 只有 0.483、D-IB 0.677;LSTM 是 0.782 和 0.921。状态数往上加,所有模型的 IB 都往下掉,Transformer 掉得最明显。Othello 上 NTP 模型的 R-IB 大约 0.56–0.70,D-IB 大约 0.61–0.80,离 1 还远。
IB 高的模型,迁到棋盘的确定性函数也更好。Majority Tiles 准确率:随机初始化的 Transformer 是 0.754,NTP 之后 0.956;Mamba-2 NTP 到 0.970。三项迁移指标与汇总比 R-IB/(1−D-IB) 的相关,Edge Balance 准确率那一列到 0.960。
模型外推时抓的不是整盘棋。它抓的是合法下一着相同的那些盘。把 D-IB 按「合法着法集合是否相同」切开,同着法、不同棋盘的 D-IBq= 一律低于不同着法的 D-IBq≠;Othello 上 Transformer 是 0.458 对 0.625。微调去复原棋盘时,棋盘经常复原错,合法着法集合却对得上。
通用 LLM 同样推不回牛顿。o3 和 Gemini 2.5 Pro 的符号回归都收成 F ∝ m1,Claude Sonnet 4 收成 F ∝ 1/(m2−0.50)。
预训练分数高不等于有世界模型,至少在这三个有真状态的序列域里不成立。合法下一着、轨迹 R²、表征里读得出状态,都保证不了新任务按那个状态外推。若要把轨道 foundation model 迁到力、能量或新边界条件,先跑 inductive bias probe,别被训练任务分数说服。
Othello 上 IB 分数和迁移表现同向,这个探针至少能当选 checkpoint 的辅助指标,比再刷合法率更贴「会不会用棋盘」。
这是受控玩具域上的诊断:next-token 预训练在这里更像在学任务启发式,尤其是合法下一 token 的粗划分。
最大的方法学限制论文自己写了:必须先指定要检验的世界模型。测得出「不是牛顿、不是棋盘」,测不出模型到底在用哪一套状态。作者试了 next-token 划分这个候选,自动发现真实归纳偏置的算法留作后续。
数据生成也很干净。轨道按牛顿定律模拟并省略行星间相互作用;7K bin 的离散坐标可能诱使模型走几何启发式。LLM 实验只有 5 个太阳系、10 个 in-context 标签,符号回归更简单也可能只是样本更少。这里的 foundation model 主要是「预训练再微调」的学习算法,不是开放权重的通用对话模型。
R-IB 和 D-IB 还吃采样分布和微调协议。附录里微调样本从 10 加到 500,Othello 上 R-IB 下降、D-IB 上升,绝对数字对协议敏感。论文没有把这套探针和标准线性 probe 做成同模型对照表。