Anthropic可解释性研究:LLM活动中存在“特权”表征

wesg52 · x · 2026-07-07

Anthropic机制可解释性研究员Jack Lindsey等工作发现:LLM用高维神经活动表征信息,其中一小部分活动表现为“特权(privileged)”表征,被认为与认知可及性相关,可能是理解模型内部表示的重要线索。

所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →