Anthropic可解释性团队正式发布语言模型J空间完整论文

wesg52 · x · 2026-07-07

Anthropic可解释性团队正式发布关于语言模型「J空间」(Judgment Space)的完整研究论文。J空间是模型激活中的小型子集,能反映模型内部状态、情感、隐性思考和安全感知,独立于输出token之外存在。该研究揭示了模型在「可报告认知」与「隐性内部处理」之间存在系统性区分,为AI可解释性和安全研究开辟了新方向。论文由Jack Lindsey、Nick Sofroniew等人与Anthropic可解释性团队共同完成。

所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →