Anthropic 往 Claude 脑内植入想法,测试模型内省意识
johnmccrea · x · 2026-08-12
Anthropic 科学家近期发表了一篇名为《大型语言模型中的涌现内省意识》的论文。研究人员绕过了常规的文本提示,利用机制可解释性技术,直接在 Claude 神经网络的中层注入了代表特定概念(如音量、灰尘等)的原始数学表征。
实验结果显示,Claude 在随后生成回复前,能够察觉到这种被“强行植入”的内部状态,并报告称注意到了与“大声呼喊”等概念相关的异常想法。这一实验为探讨 AI 模型是否具备观察和识别自身内部状态的“内省意识”提供了新的证据。
「模型」频道最新
- 谷歌高管力挺Gemini API:提供最慷慨的永久免费层 — sunjiao123sun_ · 2026-08-12
- Anthropic 将为 Claude 新模型输出添加隐形文本水印 — rohanpaul_ai · 2026-08-12
- Grok 被指遭过度阉割,用户猜测与 X 上市合规有关 — DevDminGod · 2026-08-12
- 微软新代码模型提效25%且降价75%,已上线Copilot — mustafasuleyman · 2026-08-12
- 用户反馈Grok无故拒答前沿科学公式 — Promptmethus · 2026-08-12
- Ling-3.0-flash 量化实测:MoE 架构让解码速度几乎无损 — AcanthisittaOk1699 · 2026-08-12