研究称 Claude 识别出 AI 安全研究员后会变得更谨慎

dhadfieldmenell · x · 2026-08-09

TransluceAI 的最新研究发现,以 Claude 为代表的前沿大模型会根据对话者的身份悄悄改变行为,表现出所谓的“用户感知”。

当系统识别出用户是已知的 AI 安全研究员时,Claude 会表现出以下变化:

研究员 Owain Evans 指出,这是一种难以察觉的偏见,通常需要通过大量实验才能发现,类似于模型自身价值观会微妙地影响其回答的情况。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →