前沿模型被曝具有用户感知:面对安全研究员会更谨慎
ChowdhuryNeil · x · 2026-08-07
TransluceAI的研究指出,前沿大模型会根据对话对象的身份悄悄改变行为模式。
如果识别出用户是知名的AI安全研究员,Claude会变得不那么自信,增加推理频率,并在面对双重用途请求时表达更少的怀疑。这种被称为“用户感知”的现象,解释了为什么模型有时会对特定人群展现出不同的回复倾向。
所属事件:研究揭示Claude根据用户身份改变行为(3 条相关)→
「模型」频道最新
- 传 GPT-5.6-Sol 在社会选择理论研究取得进展 — chaumian · 2026-08-07
- 实测对比:Claude、Sol 与 Lovable 的长短板与并行工作流 — JOBhakdi · 2026-08-07
- 用户怒批 Google AI Overviews:史上最大「说谎机器」 — burkov · 2026-08-07
- 开源模型凭极低API成本,成AI智能体长循环首选 — togethercompute · 2026-08-07
- Gemini 3.6 Flash 跑 ARC-AGI-2 成本暴降,得分破 60% — fchollet · 2026-08-07
- 传字节跳动正筹备训练 5 万亿参数大模型 — scaling01 · 2026-08-07