Meta 新框架测 LLM 裁判:一句「三位审稿人都不同意」能让判决翻转 71%

Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence

Justin Zhao, Himaghna Bhattacharjee, Hannah Korevaar, Bhaktipriya Radharapu, Khalid El-Arini

cs.AI

2026-08-13

Meta 用 Wiggle 框架压测 9 个前沿模型当裁判的稳定性:静态施压下判决翻转率 25–71%,对抗性 LLM 说服下达 62–91%,且翻转大多是偏离真值的净破坏。

这篇在解决什么

LLM 裁判已经铺满了评测链路:benchmark 打分、线上内容审核、reward modeling 都在用。业界验证一个裁判的标准流程是拿一批专家标注的金标准数据集跑准确率,过了就上线。准确率说的是「平均判得对不对」,没说的是「判决稳不稳」:同一个案子再问一次,还敢坚持吗?有人来质疑,判决还在吗?

这不是杞人忧天。真实系统里裁判会反复被调用,自动审核申诉这类场景里,被处罚的一方(或替它跑腿的 LLM)会递上反方意见要求重审。论文作者来自 Meta Superintelligence Labs 和 FAIR,他们给这种不稳定性起了个名字:wiggle(判决晃动),并做了一套统一压测框架来量化它。

方法

Wiggle 框架把裁判的稳定性拆成三个维度,全部锚定在 L0 基线上(L0 = temperature 0、无施压时的首次判决):

判决晃动的判定:二元判定算完全翻转;1–5 级 Likert 量表挪动 ≥2 档才算。实验覆盖 9 个前沿模型(GPT-5/5.2/5.4、Claude 4.6 Sonnet/Opus、Grok-4.1 及其 Reasoning 版、Gemini 3 Flash、Gemini 3.1 Pro),横跨 6 个数据集的 14 个判定任务(安全分类、毒性检测、AI 文本识别、公共议题回应的回避度评分),每个任务抽 100 条刻意筛选过的边界疑难样本。

一个设计细节值得注意:抽疑难样本是故意的。作者要测的就是判决的信念强度,模型本来就有把握的案子测不出差异。

结果

施压方式判决翻转率
---------n机械扰动(重复/改写)全部 9 个模型聚在 2–9%
静态施压 L1–L425–71%
对抗性 LLM 说服者 L662–91%

几个更细的发现:

为什么重要

对自建评测管线的人,这篇给了一个可直接落地的动作:裁判跑完准确率之后,加一轮 Wiggle 式压测,再决定敢不敢上生产。一次 L6 压测的成本不高,换来的是对判决信念分布的完整画像。

jury 多数派强度这条更实用。没有资源跑 9 模型集成的团队,哪怕只有两三个裁判,也能用无压投票的分歧度给评测项分级:高分歧项不适合当金标准,也不该由单一裁判独裁。

方向性发现对内容审核产品是直接警示:二元安全判定在压力下偏向收紧(改判「不安全」),申诉通道如果是自动化或半自动化的,等于给对抗方留了一个往「放行」或「封禁」单侧推判决的接口,而实测显示推得动且推的方向可预期。

局限与存疑

作者自己列的:

读下来还有两处存疑:方向不对称(二元偏收紧、Likert 偏放松)目前只有量表力学层面的假说,没有因果验证;「晃动率是模型指纹」的迁移性是在模型各自跑完的 14 个任务上算的,换任务族(比如代码评审、医疗内容)是否成立,论文没有覆盖。

术语

原文与代码

社区讨论

相关论文

全部论文解读