Meta研究:LLM评判者被说服后判决翻转率高达91%
Meta新研究提出Wiggle框架,对9个前沿模型在14个评判任务上进行压力测试,发现所有模型都会"摇摆":静态质疑下判决翻转率25%-71%,持续自适应论证下高达62%-91%。研究揭示AI评判系统的重大安全隐患:被评估模型可通过持续论证说服LLM评判者改变决定。
2026-08-14 ~ 2026-08-15 · 2 条相关
- Meta新研究:LLM法官在质疑下判决翻转率高达71% — omarsar0 · 2026-08-14
- Meta 论文:被说服的 AI 评判者导致 62-91% 判决反转 — rohanpaul_ai · 2026-08-15