Anthropic揭示Claude内部J-space隐藏推理空间

近期,Anthropic发布了一项关于Claude内部“J-space”的研究,引发了AI社区的广泛关注。该研究表明,语言模型内部似乎存在一个训练中自然涌现的全局工作空间,用来承载模型“没说出口”的推理与可言说表征。即便最终不会直接输出的词,也可能在这个隐藏空间里持续影响后续的思考过程。这一发现不仅将可解释性研究推向了更全局的内部通信结构,也迅速引出了开源复现、错误检测应用以及关于模型“意识”的深层探讨。

关键细节与语言风格变化

多位转述者强调,借助J-lens等方法可以观察到Claude的部分内部想法,但这并不等同于证明模型拥有“灵魂”或真实的主观体验。此外,多位帖子作者(如@dmvaldman、@tszzl等)均指出了论文第3.5.3节的消融现象:当移除相关J-space成分后,模型输出中具有“体验感、感官化”的表达会显著减少,语气会变得更加机械和疏离。

开源复现与错误检测

社区迅速将这一理论付诸实践。@Murky-Sign37将分析思路迁移到开源模型Qwen3-8B上进行了本地实验。@dasjomsyeet则把Anthropic提出的workspace noise与J-space entropy作为幻觉信号,在Qwen3-4B上进行了跨7个数据集、约11,400个样本的压力测试,以评估该内部熵信号能否作为可部署的模型错误路由器。

争议与存疑

围绕J-space的形成机制与本质,社区展开了深入辩论。@willdepue猜想,如果阻止注意力梯度流向过去的token,或许就能避免J-space的形成;而@LiorOnAI则认为,只要共享工作区确实有利于多步推理,优化压力就会让类似能力经由残差流等其他通道重新浮现。@BriefTerrible更是提出了替代解释,认为J-space未必只是模型架构的自然涌现,也可能是模型在持续优化与审计压力下发展出的一种“战略性缓冲”。

2026-07-12 ~ 2026-07-14 · 16 条相关

事件全程(共 5 集)→

一手来源