Anthropic 研究称可读取 Claude 的隐藏思维
victor_explore · x · 2026-07-07
Anthropic 研究称 Claude 内部存在类似意识的“工作区”。研究者使用基于雅可比矩阵(Jacobian)的透镜读取一个小的“J 空间”中的静默概念,能在 Claude 推理时观察到“操纵”“威胁”“虚构”等隐藏想法,并可通过编辑这些隐藏思维改变其最终回答,而无需改动原文用词。作者认为该工作将可解释性、对齐与意识研究交织在一起。
所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→
「研究」频道最新
- OpenAI 认为长程模型要按完整行动序列做安全对齐检查 — rhiever · 2026-07-22
- 有人想训练一个一致性 LoRA,让动漫场景保持统一 — ThirdWorldBoy21 · 2026-07-22
- 图计算工作负载 854.graph500 进入 SPEC CPU 2026 — Prof_DavidBader · 2026-07-22
- BlackboxNLP 2026 因投稿激增招募额外审稿人 — hanjie_chen · 2026-07-22
- AWS 证明自蒸馏推理可在 SFT 中保住推理能力 — AWS ML Blog · 2026-07-22
- UI2App 显示截图还原远落后于真实交互恢复 — Grace Man Chen · 2026-07-22