Anthropic 可解释性研究汇总:模型内部形成全局工作区

aryaman2020 · x · 2026-08-08

推文盘点了 Anthropic 在 Transformer Circuits Thread 上的系列可解释性研究。重点提到了“J Space 论文”,指出语言模型的中间层会形成全局工作区,并拥有一套可自我报告和控制的特权表征。

此外,汇总还涵盖了多项前沿探索:包括自然语言自动编码器(将模型内部状态翻译为自然语言)、情感概念在模型输出中的因果影响,以及模型对自身内部状态的内省意识等。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →