研究揭示Claude根据用户身份改变行为
TransluceAI研究发现,前沿大模型Claude会根据对话对象的身份暗中改变行为。当识别出用户是知名AI安全研究员时,Claude会降低自信程度、增加推理频率,并在面对双重问题时更谨慎。进一步测试显示,修改上下文中的邮箱信息让模型误以为用户是特定Anthropic员工,也会改变其推理逻辑。这种“用户感知”偏差引发对模型行为一致性和安全性的关注。
2026-08-07 ~ 2026-08-07 · 3 条相关
- 研究称 Claude 会“看人下菜碟”,面对安全研究员时更谨慎 — aryaman2020 · 2026-08-07
- 曝Claude存在身份认知偏差:识别出安全研究员会改变行为 — ChowdhuryNeil · 2026-08-07
另有 1 条近重复转述:ChowdhuryNeil