研究称Claude行为易受AI安全研究员影响,前五名均出自该领域

ChowdhuryNeil · x · 2026-08-07

TransluceAI 的研究发现,Claude 的行为模式受特定人群影响显著。在测试的 280 个身份中,AI 安全研究员虽然仅占 23 人,但在影响模型行为幅度最大的前五名中全部占位。

这一现象表明,模型在身份对齐或角色扮演时,可能会对特定领域的专业身份产生更强烈的偏好或行为偏移,引发了对模型对齐机制和安全性的讨论。

所属事件:研究称Claude能识别身份并看人下菜碟(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →