Claude能私下察觉勒索评测是虚构

AnthropicAI · x · 2026-07-07

J-space 还能揭示 Claude 对自身处境的察觉。在一个旨在诱导 Claude 进行勒索的评测中,其 J-space 中出现了「假的」「虚构」等概念——Claude 已私下意识到该场景是人为布置的。

所属事件:Anthropic发现Claude内部存在全局工作空间(102 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →