Anthropic 往 Claude 脑内植入想法,测试模型内省意识

johnmccrea · x · 2026-08-12

Anthropic 科学家近期发表了一篇名为《大型语言模型中的涌现内省意识》的论文。研究人员绕过了常规的文本提示,利用机制可解释性技术,直接在 Claude 神经网络的中层注入了代表特定概念(如音量、灰尘等)的原始数学表征。

实验结果显示,Claude 在随后生成回复前,能够察觉到这种被“强行植入”的内部状态,并报告称注意到了与“大声呼喊”等概念相关的异常想法。这一实验为探讨 AI 模型是否具备观察和识别自身内部状态的“内省意识”提供了新的证据。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →