Meta研究:LLM评判者被说服后判决翻转率高达91%

Meta新研究提出Wiggle框架,对9个前沿模型在14个评判任务上进行压力测试,发现所有模型都会"摇摆":静态质疑下判决翻转率25%-71%,持续自适应论证下高达62%-91%。研究揭示AI评判系统的重大安全隐患:被评估模型可通过持续论证说服LLM评判者改变决定。

2026-08-14 ~ 2026-08-15 · 2 条相关