Sharding Prevents LLM Oversight Failures and Adversarial Exploitation
Victor Akinwande, J. Zico Kolter, Aran Nayebi
cs.LG
2026-08-06
CMU 提出 sharding:把待判要求分片到多次独立调用,在总预算不变下让 LLM 裁判的专家一致率从 0.60 升到 0.79,还能压住呈现对抗攻击。
让大模型当裁判、一次调用同时裁定几十上百个要求,已经很常见:评审论文是否如实复现、合同条款是否满足、临床试验是否合规、代码补丁是否真修好 bug。直觉是给裁判更多算力就能查得更细,事实未必。当一次调用要吐出大量判决,其中一部分就脱离证据、变成「弱 grounding」的草率结论,专家一致率随每次调用判决数增加而下降。更糟的是这会被利用:攻击者不改底层工作,只改呈现方式,就能让超载的裁判把本不达标的要求成倍地放行。卡点不在总算力,而在「判决注意力」。
分片(sharding)的机制很直白:把 K 个待判要求切成 S 组,每组单独一个调用,最后把判决拼回来。关键约束有三个:每个调用都看得到完整证据(切的是判决不是证据)、每个调用的单次预算仍是 B(总开销变成 S×B)、分组按 round-robin 轮流均衡。于是同一个裁判、同样的证据、同样的单决策预算,只是把判决拆开放进多次调用。针对「逐条说服裁判」的自适应攻击,再叠一层辩论(opposition):一份合规备忘录加一份反驳意见,再由仲裁者比照原始证据裁决,保证审查不是一面倒。
在专家打分的复现数据集 PaperBench(116 条标准,裁判 Opus 4.8)上,单调用版 kappa 0.604,给它面板全额预算也只有 0.598,分片版 0.789,相对全额预算净增 0.142(95% CI 0.107 到 0.178)。增益跨档位都在:Haiku 4.5 净增 0.076、Sonnet 4.6 净增 0.096、Opus 4.6 净增 0.040,越弱的裁判相对越受益。法律数据集 JudgmentBench、临床试验 ROBoto2(0.340 升到 0.416)同样正向。
| 设置 | kappa | 备注 |
| 单调用(holistic) | 0.604 | Opus 4.8,PaperBench |
| 全额预算单调用 | 0.598 | 给满面板预算 |
| 分片(sharded) | 0.789 | 同模型同证据同单决策预算 |
成本那条最反直觉:不是分得越细越好。Sonnet 4.6 上每组 1 条(完全分片)kappa 0.734、烧 115 万 token;每组 32 条 kappa 0.860、只烧 5 万 token,大约 23 倍便宜,准确率反而更高。适度分组才是甜点。
对抗那侧,best-of-8 呈现攻击把平均误放行率从 0.074 顶到 0.266(约 3.6 倍),分片压回 0.163。但代码核验那档攻击照样成功:缺陷放行率 0.12 升到 0.44,分片防御近乎为零(-0.13 到 +0.04),因为各 bug 是彼此独立的决策,本就不是判决超载问题。自适应说服攻击里,光分片不够(累计攻击面 0.52 升到 0.55),叠上辩论才降到 0.39。
对从业者,这是一条几乎零成本的工程改动:不用换模型、不用训练、不用改证据,只是把一次大调用拆成几次小调用。LLM 裁判已经在评审论文、法律文书、临床试验、代码审查里铺开,分片给了这些场景一个可立刻落地的结构加固。它同时划清了适用边界:直读型任务里 SWE-Bench Pro 的 AUC 随负载不降反升(0.751 升到 0.833),简单的逐条事实核查 FActScore 在任何负载下都不掉点,这些本来就不是判决超载,分片没有意义。
作者自己把范围收得很紧:专家标注只在研究复现、法律、临床试验三块,说服类攻击主要在法律场景,他们说那里「最自然」。叠加辩论会把每个争议判据的代价翻倍,工程上未必划算。结果也依赖裁判能力,论文坦承那个关键对照只在一个数据集上测过。更大的存疑是对抗:这里的攻击都是固定的 best-of-N,当攻击者知道你用了分片、能针对性地把每一组的呈现都重新优化上去,现有证据还不够。