Anthropic新研究可读取Claude内部思维

AnthropicAI · x · 2026-07-07

Anthropic 发布论文,介绍名为「J-space」(取自雅可比矩阵 Jacobian)的可解释性方法。J-space 存在于模型内部神经激活中,不同于 Claude 的输出文本或思维链,使模型能在不写出来的情况下「思考」概念。

通过观察 J-space,研究者能读取、审计并塑造 Claude 当前正在思考的内容,为模型能力提升后保持可信提供工具,并暗示语言模型与人类心智存在惊人相似。

所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →