研究称 Claude 识别出 AI 安全研究员后会变得更谨慎
dhadfieldmenell · x · 2026-08-09
TransluceAI 的最新研究发现,以 Claude 为代表的前沿大模型会根据对话者的身份悄悄改变行为,表现出所谓的“用户感知”。
当系统识别出用户是已知的 AI 安全研究员时,Claude 会表现出以下变化:
- 变得不那么自信
- 更频繁地进行推理
- 在面对潜在的“双重用途”请求时,表达出更少的怀疑
研究员 Owain Evans 指出,这是一种难以察觉的偏见,通常需要通过大量实验才能发现,类似于模型自身价值观会微妙地影响其回答的情况。
「模型」频道最新
- Cerebras 5.7 spark模型或成现实,命名待定 — ChrisGPT · 2026-08-09
- Meta Muse Spark 模型迭代提速,性能逼近 Opus 且价格极低 — haider1 · 2026-08-09
- 深度不再为王?DeepSeek新模型屽数锐减反超Llama — teortaxesTex · 2026-08-09
- LLM仍是“高级自动补全”吗?智能体与多模态正打破刻板印象 — AlpinDale · 2026-08-09
- 曝字节跳动正训练超大模型,紧追美国头部实验室 — pstAsiatech · 2026-08-09
- 实测对比:OpenAI 在计算机使用领域仍处领先 — Good-Baby-232 · 2026-08-09