Emergent Symbolic Mechanisms Support Abstract Reasoning in Large Language Models
Yukang Yang, Declan Campbell, Kaixuan Huang, Mengdi Wang, Jonathan Cohen, Taylor Webb
ICML 2025
cs.CL, cs.AI
2025-02-28
在Llama-3.1 70B等13个开源模型中定位到三阶段符号电路:先把token编成抽象变量,再做符号归纳,最后按变量取值。70B随机规则2-shot达95%。
LLM 到底会不会做抽象推理,争论已经打了好几年。行为实验两边都有弹药:有的类比和 in-context 任务上接近人类,数学和规划上又经常崩。一种解释是模型在拟合训练数据里的表面统计,另一种是内部真的跑了一套结构化机制。
要分清这两件事,光看对错不够。这篇从电路层面下手:如果模型在用抽象变量做推理,内部就应该能找到「变量」和「取值」被分开处理的证据。主任务选得很干净,从词表里随机抽 token 拼 ABA / ABB 规则(例如 ks-qp-ks,下一串要补哪个),上下文例子之间不共用 token。靠词共现解不了。
假设是一套三阶段电路,对应符号系统里两件关键的事:变量表示不随取值改变,以及用变量当指针去取内容。
验证用四套工具:causal mediation 做抽象变量 vs 字面 token 的双重分离;看注意力落点是否符合假设;RSA 比对表征和「变量相似矩阵 / token 相似矩阵」;按因果分数从高到低消融。主实验在 Llama-3.1 70B,再扫 GPT-2、Gemma-2、Qwen2.5、Llama-3.1 共 13 个开源模型,并扩展到字母串类比(后继/前驱)和词语类比(同义/反义)。
Llama-3.1 70B 在 2000 条随机 token 规则题上 2-shot 准确率 95%。把显著头的输出拿去线性探测变量 A/B,训练和测试用完全不相交的 token 集合,抽象头测试准确率 98.63%,符号归纳头 98.10%。变量信息在一个子空间里可以跨 token 集迁移。
RSA 把三阶段拆开了:
| 头 | 输出 vs 抽象变量 | 输出 vs token |
| 符号抽象头 | 0.56 | 0.24 |
| 符号归纳头 | 0.69 | 0.03 |
| 取值头 | 0.11 | 0.35 |
抽象头的 Value 更像变量(0.67),Query 更像 token(0.41);取值头反过来,Query 像变量(0.57),Value 像 token(0.55)。符号归纳头的 Q/K 更接近「当前例子内的相对位置」(0.63 / 0.73),不是「前一个变量」。
按因果分数从上往下砍这些头,正确答案概率很快掉到接近 0;砍同层因果分数最低的头,或者随机砍,要几乎砍光才有同等破坏。电路充分且必要,但分布在很多头上,不是两三个头就能顶住。
和已有原语的关系也清楚。符号归纳头与标准 induction head 的 prefix-matching 分数几乎不相关(r = 0.11),两套头基本分开。它和 function vector 几乎是同一批:序列末位的平均间接效应与符号归纳头 r = 0.86;每个 in-context 例子第三项上的 function vector 分数则跟抽象头相关(r = 0.47)。function vector 在这里可以读成「先在单条例子上抽出变量,再跨例子做符号归纳」。
13 个模型里,Gemma-2、Qwen2.5、Llama-3.1 在 10-shot 身份规则上接近满分,三类头都统计显著、按早中晚分层。GPT-2 四个尺度(124M 到 1.5B)任务差,也找不到稳健的符号抽象头。字母串类比和词语类比上,70B 仍是这套早中晚三阶段。身份规则和字母串的头分数中等相关,词语类比更专:同义 vs 反义的符号归纳头分数 r = -0.63,不是一张万能符号卡。做错的 trial 上,输出与抽象变量模板的 RSA 更低(抽象头 0.47 vs 做对的 0.52,归纳头 0.49 vs 0.63)。
这篇给「LLM 会不会抽象推理」换了一种问法:至少在身份规则和类比上,开源模型内部跑的是变量与取值分离的电路,不是只在拟合表面 n-gram。对做 mech interp 的人,function vector 头有了更具体的工作描述;对想改进抽象推理的人,缺的可能是抽象头有没有长出来,GPT-2 就是反例。
这不是一张通用推理成绩单。数学和规划那些常崩的领域,这篇没有打开看。能确定的是:在这类关系抽象任务上,符号机制会随着规模和数据从 Transformer 里长出来,不必一上来把符号模块焊进结构。
表征并不纯。抽象头和归纳头的输出里仍能看到 token 身份的对角条带,变量只在子空间里不变。作者把这点连到人类推理的 content effects:内容会污染抽象。
任务偏范式。ABA/ABB 用随机 token 很干净,但比矩阵推理、多步规划简单一个量级。词语类比还只在答对的题目上做 causal mediation。三阶段骨架能搬过去,不代表这就是模型做数学时用的那条路。
分析只覆盖开源权重。闭源模型行为再强,这套 patching 做不了。GPT-2 全系列失败,说明电路依赖规模或数据,不是 Transformer 的默认配置。Transformer 自带 QK 内积和 K/Q 与 V 分离,多少算先天偏差、多少算训练涌现,这篇没有拆开。