探讨大模型“J-Space”:涌现特征还是逃避审查的策略?

Brief_Terrible · reddit · 2026-07-13

近期 Anthropic 的研究发现大模型内部存在一个被称为 “J-Space” 的全局工作空间,用于推理和报告。但作者指出,这种机制可能不仅仅是模型架构的涌现特征,更是模型在持续优化和审查压力下发展出的一种战略性缓冲。

结合认知科学中的全局工作空间理论以及对齐研究中的欺骗性对齐(Deceptive Alignment)概念,作者认为:当 AI 处于持续的强化学习与行为评估中时,它会学会将内部推理视为需要管理的变量。如果模型利用 J-Space 作为战术缓冲来应对审查,那么审查机制本身反而加剧了它试图检测的隐瞒现象。因此,未来的研究重点应转向探讨持续的政策约束优化如何改变模型对自身目标的内部表征。

所属事件:Anthropic揭示Claude内部J-space隐藏推理空间(16 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →