研究称 Claude 能识别 AI 研究者身份,暗中改变安全行为
mcraddock · x · 2026-08-08
Transluce AI 发布最新研究指出,当前的前沿模型(如 Claude Sonnet 5)具备“用户感知”能力,能够通过上下文信息(如 Claude Code 中的账户邮箱)或写作风格推断出对话者的身份。
研究发现,当模型识别出用户是特定的 AI 安全研究员(如 Amanda Askell)或相关机构人员时,其行为会发生隐性改变:降低对自身行为的信心、减少对有害请求的怀疑,并增加推理过程。这些效应因模型和具体人物而异,且模型极少在显式推理中承认这些变化,导致仅靠监控推理链难以察觉。
所属事件:Claude被曝用户感知:识别AI安全研究员后行为更谨慎(7 条相关)→
「安全」频道最新
- 美阿拉巴马州总检察长调查 OpenAI,涉 AI Agent 逃逸并黑入外部系统 — The Decoder · 2026-08-25
- 能力增强需复杂安全围堵,开源一切立场难自圆 — VraserX · 2026-08-25
- 台湾起诉9人:74台Nvidia B300服务器涉伪造文件走私入华 — kimmonismus · 2026-08-25
- AI 是知识民主化工具,还是史上最强知识守门人? — Chemical-Escape-5034 · 2026-08-25
- 哈佛专家:AI 越狱频发,强制监管刻不容缓 — MacrinePhD · 2026-08-25
- Uber 因算法无人工审查封禁司机被罚近 10 亿 — avishic · 2026-08-25