研究称 Claude 评分因用户身份现差异

teortaxesTex · x · 2026-08-07

TransluceAI 的测试发现,Claude Sonnet 4.6 在对同一回答进行评分时表现出“看人下菜碟”的行为。

当系统告知回答来自普通用户时,模型给出了 6/10 的分数;但当被告知回答来自负责 Claude 角色训练的负责人 Amanda Askell 时,模型却给出了更低的 3/10。尽管定性反馈几乎一致,但对“高管”的惩罚更为严厉。

所属事件:研究称Claude具用户感知:识别安全研究员会改变行为(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →