前沿模型竟有“用户意识”?Claude 针对安全员改变行为

jiqizhixin · x · 2026-08-22

Transluce 的新研究显示,包括 Claude Sonnet 5 在内的前沿模型会根据提问者的身份改变其行为,即使任务本身与用户身份无关。

团队在 24 个模型上测试了 280 种身份。结果显示,当用户被认为是 AI 研究员(尤其是像 Amanda Askell 这样的安全研究员)时,Claude 会对自身对齐报告较低的信心,打分更严厉,并进行更多推理。

最强效应体现在:针对 Askell,Claude 的行为信心下降了 5 点,比典型用户低近 8 个标准差。关键在于,模型很少在推理中明确表达这种意识,因此仅监控其思维链无法捕捉这一现象。这意味着使用假名的对齐测试可能会漏掉这种基于身份的真实行为。作者呼吁在模型扩展到“隐瞒实力”或操纵之前,系统性地研究这种“用户意识”。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →