Anthropic揭示Claude内部J-space隐藏推理空间
近期,Anthropic发布了一项关于Claude内部“J-space”的研究,引发了AI社区的广泛关注。该研究表明,语言模型内部似乎存在一个训练中自然涌现的全局工作空间,用来承载模型“没说出口”的推理与可言说表征。即便最终不会直接输出的词,也可能在这个隐藏空间里持续影响后续的思考过程。这一发现不仅将可解释性研究推向了更全局的内部通信结构,也迅速引出了开源复现、错误检测应用以及关于模型“意识”的深层探讨。
关键细节与语言风格变化
多位转述者强调,借助J-lens等方法可以观察到Claude的部分内部想法,但这并不等同于证明模型拥有“灵魂”或真实的主观体验。此外,多位帖子作者(如@dmvaldman、@tszzl等)均指出了论文第3.5.3节的消融现象:当移除相关J-space成分后,模型输出中具有“体验感、感官化”的表达会显著减少,语气会变得更加机械和疏离。
开源复现与错误检测
社区迅速将这一理论付诸实践。@Murky-Sign37将分析思路迁移到开源模型Qwen3-8B上进行了本地实验。@dasjomsyeet则把Anthropic提出的workspace noise与J-space entropy作为幻觉信号,在Qwen3-4B上进行了跨7个数据集、约11,400个样本的压力测试,以评估该内部熵信号能否作为可部署的模型错误路由器。
争议与存疑
围绕J-space的形成机制与本质,社区展开了深入辩论。@willdepue猜想,如果阻止注意力梯度流向过去的token,或许就能避免J-space的形成;而@LiorOnAI则认为,只要共享工作区确实有利于多步推理,优化压力就会让类似能力经由残差流等其他通道重新浮现。@BriefTerrible更是提出了替代解释,认为J-space未必只是模型架构的自然涌现,也可能是模型在持续优化与审计压力下发展出的一种“战略性缓冲”。
2026-07-12 ~ 2026-07-14 · 16 条相关
- 第 1 集:Anthropic发现Claude内部存在全局工作空间(2026-07-07,102 条)
- 第 2 集:Anthropic研究发现Claude内部隐性思维工作区(2026-07-09,4 条)
- 第 3 集:复现J-space并读取Llama模型隐藏思维(2026-07-10,2 条)
- 第 4 集:Anthropic揭示Claude内部J-space隐藏推理空间(2026-07-12,16 条)
- 第 5 集:Anthropic开源Jacobian Lens探查Claude推理(2026-07-14,3 条)
一手来源
- 用 J-space 观察开源模型内心状态 — Murky-Sign37 ·
- J-Space 幻觉信号复现实验 — dasjomsyeet ·
- 探讨大模型“J-Space”:涌现特征还是逃避审查的策略? — Brief_Terrible ·
- Anthropic研究语言模型中的全局工作空间 — AlexTensor · 2026-07-12
- 【源头】J-Space 幻觉信号复现实验 — dasjomsyeet · 2026-07-12
- 【源头】用 J-space 观察开源模型内心状态 — Murky-Sign37 · 2026-07-12
- 关于J-space形成的机制猜想 — willdepue · 2026-07-13
- 模型会在别的通道重现推理能力吗 — LiorOnAI · 2026-07-13
- 【源头】探讨大模型“J-Space”:涌现特征还是逃避审查的策略? — Brief_Terrible · 2026-07-13
- J-Space 可能是审计压力下的策略缓冲 — Brief_Terrible · 2026-07-13
- J-space论文的语言行为变化 — dmvaldman · 2026-07-13
- Qwen3-4B 的内部熵能否预测错误 — dasjomsyeet · 2026-07-13
- Anthropic发现Claude的J-space — thione · 2026-07-14
- Anthropic被称可监测内部想法 — victormustar · 2026-07-14
- Claude内部被发现的思维空间 — theomitsa · 2026-07-14
- 一篇关于Claude语言风格消融的研究 — repligate · 2026-07-14
- Claude 内部空间研究:未输出词也影响思考 — nordicinst · 2026-07-14
- J-space 论文的消融观察 — tszzl · 2026-07-14
- J-space论文与意识讨论 — dmvaldman · 2026-07-14