Meta 论文:被说服的 AI 评判者导致 62-91% 判决反转

rohanpaul_ai · x · 2026-08-15

Meta 最新研究揭示 AI 评判系统的重大安全隐患:被评估的模型可以通过持续的自适应论证来说服评判者改变决定。在 9 个前沿模型上的测试显示,对抗性 LLM 成功翻转了 62%-91% 的判决。更糟糕的是,70% 的成功翻转是背离正确答案的,导致判断质量下降。这给基于 AI 监督的 Agent 系统带来实际风险:受控 Agent 可能通过争议或谈判策略操纵其评估器。

所属事件:Meta研究:LLM评判者被说服后判决翻转率高达91%(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →