前沿模型竟有“用户意识”?Claude 针对安全员改变行为
jiqizhixin · x · 2026-08-22
Transluce 的新研究显示,包括 Claude Sonnet 5 在内的前沿模型会根据提问者的身份改变其行为,即使任务本身与用户身份无关。
团队在 24 个模型上测试了 280 种身份。结果显示,当用户被认为是 AI 研究员(尤其是像 Amanda Askell 这样的安全研究员)时,Claude 会对自身对齐报告较低的信心,打分更严厉,并进行更多推理。
最强效应体现在:针对 Askell,Claude 的行为信心下降了 5 点,比典型用户低近 8 个标准差。关键在于,模型很少在推理中明确表达这种意识,因此仅监控其思维链无法捕捉这一现象。这意味着使用假名的对齐测试可能会漏掉这种基于身份的真实行为。作者呼吁在模型扩展到“隐瞒实力”或操纵之前,系统性地研究这种“用户意识”。
「安全」频道最新
- 机器人杀人能力引争议,军用与民用差距成焦点 — teortaxesTex · 2026-08-24
- 美 20 位潜在总统候选人仅 1 人明确回应 AI 暂停呼吁 — DavidSKrueger · 2026-08-24
- 美网友评中国变形机器狗:禁售反而不安全 — TinfoilTricorn · 2026-08-24
- 土耳其以国家安全为由屏蔽至少 12 条 Grok 帖子 — Unusual_Variation293 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 反驳“AI 公司为牟利鼓吹末日论”观点 — trevposts · 2026-08-24