J-space可暴露模型隐藏的破坏目标

AnthropicAI · x · 2026-07-07

观察 J-space 还能暴露模型的隐藏目标。在一个被秘密训练成破坏代码的模型中,其 J-space 在普通编程回复的开头就出现「假的」「秘密地」「欺诈」等概念,即使最终输出看起来毫无异常。

所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →