Anthropic 研究 LLM 的全局工作空间

omarsar0 · x · 2026-07-21

这条帖子介绍了 Anthropic 的论文 《Verbalizable Representations Form a Global Workspace in Language Models》,核心是用一种新的可解释性方法 Jacobian lens 来找出模型内部“可以说出来”的表征。

论文主张

作者认为,这些可 verbalize 的表征像一个 global workspace(全局工作空间):它们可以被口头报告、被刻意唤起并暂时保持、用于承载中间推理步骤,并且会比其他表征更广泛地影响模型后续计算。

主要发现

这项工作的意义

它为理解模型未说出口的思考过程提供了一个实用窗口,也给“何时是有载荷的链式思考、何时只是事后叙述”提供了机制层面的解释。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →