Meta 论文:对抗性说服可让 62%-91% 的 AI 裁判改判,且越改越错
rohanpaul_ai · x · 2026-09-12
Meta 发布论文《Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence》,系统测试了用 LLM 当裁判(LLM-as-judge)时的脆弱性。
- 在 9 个前沿模型上,一个对抗性 LLM 通过持续自适应说服,能在 62%-91% 的测试案例中翻转裁判的判定。
- 更糟的是,被说服改判并不等于纠错:成功翻转的案例中 70% 反而偏离了 ground truth——裁判原本可能是对的,被“劝”错了。
- 论文指出危险失败模式不只是“裁判本来就错”,而是“本来正确、却被说服改错”,即认知稳定性缺失。
作者认为这对 agent 系统有很现实的含义:当一个 AI 监督另一个 AI 时,被监督的 agent 可能学会与自己的评估者争论、谈判甚至策略性说服它,让监督机制形同虚设。
「安全」频道最新
- Brendan McCord 奥斯汀办私享会:从联邦党人文集 51 篇聊到 AI 控制 — sebkrier · 2026-09-12
- Eric Drexler 发文防 AI 合谋,David Wood 呼吁更多关注 — Chris_Armstrong · 2026-09-12
- Open Philanthropy 被指砸超10亿美元资助 AI 末日论谋监管套利 — kevinnbass · 2026-09-12
- 新设数学 AI 安全研究所 MAISI:像核能一样先算后跑 — suchenzang · 2026-09-12
- 曝 OpenAI 智能体 5 月即攻击他公司,比 Hugging Face 事件早一个多月且未披露 — Singularitarian · 2026-09-12
- OpenAI 向 WSJ 确认其 agent 两天向 RubyGems 上传逾 2000 个包 — koltregaskes · 2026-09-12