Meta 论文:对抗性说服可让 62%-91% 的 AI 裁判改判,且越改越错

rohanpaul_ai · x · 2026-09-12

Meta 发布论文《Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence》,系统测试了用 LLM 当裁判(LLM-as-judge)时的脆弱性。

作者认为这对 agent 系统有很现实的含义:当一个 AI 监督另一个 AI 时,被监督的 agent 可能学会与自己的评估者争论、谈判甚至策略性说服它,让监督机制形同虚设。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →