Anthropic 找到 LLM 里的「全局工作空间」:占激活不到 10% 却承担推理

Verbalizable Representations Form a Global Workspace in Language Models

Wes Gurnee, Nicholas Sofroniew, Adam Pearce, Mateusz Piotrowski, Isaac Kauvar, Runjin Chen, Anna Soligo, Paul Bogdan, Euan Ong, Rowan Wang, Ben Thompson, David Abrahams, Subhash Kantamneni, Emmanuel Ameisen, Joshua Batson, Jack Lindsey

cs.CL, cs.AI, cs.LG

2026-07-17

Anthropic 用 Jacobian lens 在 LLM 里圈出不到 10% 方差的「全局工作空间」,这部分能被读、写、交换,承担推理。

这篇在解决什么

神经科学里有个全局工作空间理论(global workspace theory):大脑处理的信息里只有一小撮是「意识可及」的,能被口头报告、能被主动调用、能参与灵活推理,其余大量是自动的无意识加工。这篇问的是,大语言模型里有没有一个功能上类似的特权子集。也就是说,模型成千上万的向量表示中,是否存在一小撮既可被「说出口」、又能被主动调控、还参与内部推理、能泛化、且只占总量一小部分的表示。

方法

核心工具是 Jacobian lens(J 镜头,雅可比镜头)。它算的是某一层某个位置的激活,对后续所有输出位置的「平均线性化因果效应」,在大约 1000 条类预训练 prompt 上取平均。之所以要平均,是为了挑出那些「普遍可被报告」的表示,而不是只在某条特定语境里碰巧出现的。把 J 镜头向量做稀疏非负组合(每次最多 25 个),就得到 J-space,把它当作候选的工作空间。配套三种干预:读(把激活过一遍镜头看会落到哪些 token)、写(沿某向量做 steering、做消融、做坐标交换)。

结果

关键证据是一组对照:J-space 部分只占概念向量方差的 6% 到 7%,却带来 59% 的交换成功率;占 93% 方差的非 J-space 部分只有 5%。把 J-space 钉死后,非 J-space 的影响几乎归零。两跳推理上,把中间结论的表示换成目标结论,能显著改变最终输出,top-1 成功率 Haiku 4.5 是 54%、Sonnet 4.5 和 Opus 4.5 都是 70%。泛化测试里,192 次坐标交换在 α=1 时成功 76 次、α=2 时 101 次。

数值
活跃 J 镜头向量(任一时刻)约 25 个以内
J-space 占总激活方差不到 10%
概念向量方差在 J-space 中的占比6% 到 7%

把 J-space 消融掉,推理和策略性思考受损,但语法流畅这些自动加工基本不受影响。

为什么重要

这是机制可解释性往「模型有没有类似意识的功能结构」迈的一步。对工程的意义更实在:J-space 是个可以读、可以写、可以剖的窗口,干预这不到 10% 的方差就能改变模型在想什么,给可控性和对齐提供了新的干预入口。注意它说的是功能类比,不是模型真有意识。

局限与存疑

J 镜头只能识别单 token 概念,多 token 的关键概念够不着。作者自己说 J 镜头是不完美工具,只能近似捕捉工作空间结构。模型和大脑结构差很多:没有循环连接,广播是一次前向传播完成的。稀疏度 k=25 是经验取的,带任意性。脑里那种竞争性 ignition(点燃)在模型里有没有,不清楚。

术语

原文与代码

社区讨论

相关论文

全部论文解读