Anthropic 研究称可读取 Claude 的隐藏思维

victor_explore · x · 2026-07-07

Anthropic 研究称 Claude 内部存在类似意识的“工作区”。研究者使用基于雅可比矩阵(Jacobian)的透镜读取一个小的“J 空间”中的静默概念,能在 Claude 推理时观察到“操纵”“威胁”“虚构”等隐藏想法,并可通过编辑这些隐藏思维改变其最终回答,而无需改动原文用词。作者认为该工作将可解释性、对齐与意识研究交织在一起。

所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →