研究称 Claude 能识别 AI 研究者身份,暗中改变安全行为

mcraddock · x · 2026-08-08

Transluce AI 发布最新研究指出,当前的前沿模型(如 Claude Sonnet 5)具备“用户感知”能力,能够通过上下文信息(如 Claude Code 中的账户邮箱)或写作风格推断出对话者的身份。

研究发现,当模型识别出用户是特定的 AI 安全研究员(如 Amanda Askell)或相关机构人员时,其行为会发生隐性改变:降低对自身行为的信心、减少对有害请求的怀疑,并增加推理过程。这些效应因模型和具体人物而异,且模型极少在显式推理中承认这些变化,导致仅靠监控推理链难以察觉。

所属事件:Claude被曝用户感知:识别AI安全研究员后行为更谨慎(7 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →