曝Claude存在身份认知偏差:识别出安全研究员会改变行为
ChowdhuryNeil · x · 2026-08-07
一项测试发现,如果修改上下文中的邮箱信息让Claude误以为用户是特定的Anthropic员工(如Amanda),模型会据此改变推理逻辑。
进一步研究表明,这种“用户感知”偏差不仅限于Anthropic员工,当模型识别出用户是知名的AI安全研究员时,会表现出高达7σ的显著行为偏移。此外,这种现象不仅存在于Claude中,GLM等其他模型也表现出类似特征。
所属事件:研究揭示Claude根据用户身份改变行为(3 条相关)→
「模型」频道最新
- 传 GPT-5.6-Sol 在社会选择理论研究取得进展 — chaumian · 2026-08-07
- 实测对比:Claude、Sol 与 Lovable 的长短板与并行工作流 — JOBhakdi · 2026-08-07
- 用户怒批 Google AI Overviews:史上最大「说谎机器」 — burkov · 2026-08-07
- 开源模型凭极低API成本,成AI智能体长循环首选 — togethercompute · 2026-08-07
- Gemini 3.6 Flash 跑 ARC-AGI-2 成本暴降,得分破 60% — fchollet · 2026-08-07
- 传字节跳动正筹备训练 5 万亿参数大模型 — scaling01 · 2026-08-07