The information geometry of large language models is shared, learned, and controllable
Dario Picozzi
cs.LG, cs.CL
2026-09-10
下一词Fisher几何由行为确定,跨十个模型秩相关0.88,高于激活空间0.62。同一校正把GPT-2编辑的非目标KL降到欧氏对照的约1/10。
激活空间里的欧氏距离支撑着现在大多数 steering、特征重要性和微调正则。问题是,同一套输入输出可以换一套可逆线性坐标来实现,欧氏长度会跟着变,几何并不由行为决定。下一词概率分布这边有规范度量:Chentsov 定理说,在保持统计信息的变换下,Fisher-Rao 度量(差一个总尺度)是唯一的。行为空间有特权几何,表示空间没有。
UCL 这篇把输出 Fisher 拉回到干预层,用它回答三件事:独立训练的模型有没有共享几何、语言统计能不能预测几何和学习节奏、按这个几何改行为会不会比欧氏更新少伤别的预测。
把干预层激活 h 映到下一词分布 p,输出 Fisher 是词嵌入在 p 下的协方差,再经网络雅可比拉回得到 G。小扰动的 KL 近似是 1/2 δhᵀGδh。要对某个目标梯度 q 达到指定一阶改变,阻尼自然梯度 (G+αR)⁻¹q 是正则化后输出代价最小的一步。
跨模型比较不需要对齐词表或隐藏坐标。同一批上下文上,每个模型给出下一词分布两两之间的 Fisher-Rao 距离矩阵,用上三角的 Spearman 相关衡量它们是否把「近/远」排成一样。受控实验把同一套事实随机分给浅层或深层证据构造,看习得时间。干预实验在匹配目标改变的前提下,比较欧氏步和自然梯度步的非目标 KL。
十个模型覆盖 Transformer、状态空间和循环结构,70M 到 7B,七条训练管线、四种分词器。自然文本上输出几何的平均秩相关是 0.88,中间层激活 0.62,末层 0.61。把下一词压到剩余文本的首字节后,跨分词器相关仍是 0.91。共享成分带着语义:八类探针跨模型准确率 0.66,只走共识几何是 0.70,模型内 0.72,随机 0.125。受控合成语言上,改条件律能收回超过 99% 的指定几何间隔,同律换架构几乎不动几何。
人类补全也跟着预测拟合靠近。Pythia 上语义平方距离从 70M 的约 0.34 降到 2.8B 的 0.30;在另一套 384 上下文上,用 Pythia 拟合的「风险-对齐」关系零样本预测 OLMo 和五个外部模型,相关 0.76,RMSE 0.029。
谱这边,输出 Fisher 特征值在秩 22-80 近似按 i⁻¹ 衰减。只用 token 概率加权的读出轮廓、不拟合参数,就能预测有效维,五个外部家族的中位 RMSE 为 0.027-0.052。语料 n-gram 边际在训练前就能预测新事实的习得轨迹,R² 0.775-0.792,时间误差 0.77-0.96 个 log₂ 步。把同样事实随机分到深层证据,习得时间分位数大约是浅层的 4.3 倍;GPT-2 / GPT-NeoX / Llama 风格解码器上延迟 1.75-2.86 倍。
干预上,11 个模型、六个家族、三个目标,3515 次匹配测量里,有限阻尼代价比的实测/预测中位数是 0.967。逐步重线性化的路径上,Fisher 累计局部 KL 是欧氏对照的 1/11.5 到 1/127。四个 donor prompt 上学到的更新能转到未见 prompt,相对欧氏对照,参考续写的序列 KL 降到约 1/2.9-1/6.3。同一校正覆盖编辑、归因、词典学习和微调:
| 操作 | 相对欧氏/Adam 的主要数字 |
| 事实 steering | 非目标 KL 最多低 72.7 倍 |
| GPT-2 CounterFact 编辑 | 其他 token KL 几何平均低 10.57 倍 |
| SAE 特征抹除 | Fisher 代价与真实 KL 相关 0.997 |
| 自然梯度 LoRA | 70M 上保真 KL 前沿优于 AdamW+KL 1.57 倍 |
对齐其实是两个问题:改什么,以及怎么改才少动别的。这篇只回答第二个。给定外部给的目标方向,输出几何提供最小扰动的局部更新,而且代价比可以事先算,不用拟合。对做 steering、知识编辑和带保真约束微调的人,这是把欧氏内积换成拉回度量的一处替换,不是新目标函数。
模型大多在 70M-7B,知识编辑主结果在 GPT-2 的 30 条 CounterFact 上。局部二次近似会随步长衰减,三个干预幅度上实测/预测几何平均从 0.918 降到 0.755。LoRA 实验只证明局部保真,不证明安全能力还在。算 G 要雅可比-向量积,虽然相对阻尼下共轭梯度最坏 85 步、与宽度无关,仍然不是免费的。几何不告诉你该追求哪一种行为。人类对照是补全常模,不是完整使用场景。