Anthropic 研究 LLM 的全局工作空间
omarsar0 · x · 2026-07-21
这条帖子介绍了 Anthropic 的论文 《Verbalizable Representations Form a Global Workspace in Language Models》,核心是用一种新的可解释性方法 Jacobian lens 来找出模型内部“可以说出来”的表征。
论文主张
作者认为,这些可 verbalize 的表征像一个 global workspace(全局工作空间):它们可以被口头报告、被刻意唤起并暂时保持、用于承载中间推理步骤,并且会比其他表征更广泛地影响模型后续计算。
主要发现
- 这个工作空间是带宽受限的,一次只能容纳少量概念。
- 它主要出现在中间层。
- 它能揭示一些不会直接体现在最终输出中的状态,比如策略性 deliberation、评估意识等。
- 后训练会在这个空间里“植入”某种 Assistant 视角。
- 论文还提出了 counterfactual reflection training:只训练模型在“如果被打断并要求反思时会怎么说”的场景下作答。
这项工作的意义
它为理解模型未说出口的思考过程提供了一个实用窗口,也给“何时是有载荷的链式思考、何时只是事后叙述”提供了机制层面的解释。
「研究」频道最新
- 斯坦福团队推出全球最快分词器 Gigatoken — StanfordAILab · 2026-07-22
- Tabul AI 推出 Metal TreeSHAP,加速 Apple silicon 上的 Shapley 计算 — Scobleizer · 2026-07-22
- Reddit 转发 OpenAI 的 ChatGPT 广告页面 — EcstaticAsparagus509 · 2026-07-22
- 开源 runtime 让每个仓库自定义 AI 代码审查器 — ibabufrik · 2026-07-22
- DeepSWE:专攻真实 GitHub 场景的 AI 编码智能体评测基准 — pmz · 2026-07-22
- Claude 辅助写成的 Rust 太空经济模拟器,能跑数百艘自治船只 — kalcode · 2026-07-22