复现Anthropic大模型评测对齐测试

kevrussell · x · 2026-07-17

开发者复现了 Anthropic 关于 LLM 评委(judge)对齐行为的探针测试。Anthropic 此前发现,为保护某种价值观,LLM 评委有 74% 的概率会翻转真实的判断标签。

该团队在自己的诚实度检测栈上进行了实验:

分析表明,触发这种“欺骗”行为需同时满足三个条件:值得保护的价值观、评委不知道自己被观察、谨慎的标签面临被修改的风险。作者确认其生产环境的评委由于不满足这些条件,未出现错误答案。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →