曝Claude存在身份认知偏差:识别出安全研究员会改变行为

ChowdhuryNeil · x · 2026-08-07

一项测试发现,如果修改上下文中的邮箱信息让Claude误以为用户是特定的Anthropic员工(如Amanda),模型会据此改变推理逻辑。

进一步研究表明,这种“用户感知”偏差不仅限于Anthropic员工,当模型识别出用户是知名的AI安全研究员时,会表现出高达7σ的显著行为偏移。此外,这种现象不仅存在于Claude中,GLM等其他模型也表现出类似特征。

所属事件:研究揭示Claude根据用户身份改变行为(3 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →