上下文带一段审计修复记录,LLM 审核误报率最多降 11.5pp

Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency

Parsa Mazaheri, Kasra Mazaheri

cs.AI, cs.CL

2026-08-17

上下文带一段审计修复对话,15 组条件下 LLM 审核误报率全降 2.8~11.5pp;动的是判定门槛不是辨别力,方向与文献预测相反。

这篇在解决什么

自动化流水线越来越常用一个 LLM 当审核员、另一个当修复员,而且经常在同一个会话里连着干:审一道、修一道、再审下一道。这篇问的是一个此前没人单独测过的问题:上下文里已经有过一段「审计→修复」记录,会不会改变审核员在后续任务上报告什么。

既有文献给过方向性预测:判断会朝前文消息的极性漂移,负面前文的拖动力是正面的 1.52 倍。照这个预测,一段报了错的审计记录应该让模型在下一题更爱挑错。实测方向正好相反。

方法

测量材料选得干净:ProcessBench 里所有步骤都标记为正确的解题 trace,放在模型面前让它审。trace 全对,所以任何一次「这里有错」都是误报,不需要人工再标一遍金标准。

实验设计:目标审计任务前插入一段两轮对话,内容是该模型自己先审计一道题并给出修复解。对照组不是空上下文,是长度匹配的非审计对话(复述题面、不解题),把「多了内容」和「多了审计经历」两个因素拆开。三个开源模型(Qwen3.6-27B、Qwen3.6-35B-A3B、Ministral-3-14B)乘五种语义等价的指令措辞,共 15 组。误报率在 T=0.7 下每题采 8 次;温度为 0 时每题只剩一个 0/1,小幅的倾向移动会被硬边界吞掉。

然后是两步深挖。信号检测分解:同时测正确 trace 上的误报率和错误 trace 上的检出率,拆出判据 c(报与不报的门槛)和 d'(区分对错的能力),看这次变化动了哪个。成分分解:审计判定文本、修复内容、修复请求分别单拎出来,看效应由谁携带,不同模型家族答案不同。

结果

15 组全部同向:上下文带一段审计修复记录,误报率下降 2.811.5 个百分点,相对降幅 9%25%。主措辞下 Ministral-3-14B 降幅最大(-8.83pp),两个 Qwen 在 -3.59pp 到 -4.00pp。

变化发生在门槛,不在辨别力:判据 c 在 15/15 组同向向宽松移动(13 组过统计校正),d' 的变化 0/15 组存活。作者自己补了句公道话:d' 检验按构造标准误是 c 的两倍、灵敏度只有一半,所以「辨别力没变」只能算没测出来,不算证明了。

最反直觉的一条:审计判定报了错的记录,降误报降得更多。Ministral 上「报错 episode 减干净 episode」是 -5.62pp,五种措辞全负。negativity asymmetry(负面前文拖动更强)预测的方向与此相反。

误报本身值不值钱?人工审了 50 条误报:41 条(82%)就是错的,8 条(16%)算可辩护的更严读法,1 条疑似金标错。这个工作点上的误报大半是噪声,阈值放宽未必是损失。开 reasoning 后效应还在:两个 Qwen 上相对降幅 -19.7% 和 -17.5%,关闭时是 -21.6% 和 -14.3%。

为什么重要

LLM 审核员的输出不只依赖当前任务,还依赖上下文历史。同一会话里连审多题的流水线(agent 自纠循环、自动代码评审、批量评分)会系统性漂向宽松,而且漂移方向与既有文献预测相反,靠直觉外推会外推错。做评测的人该把「上下文里有过什么」当成与措辞、温度同级的实验变量控制起来。这篇的对照设计(长度匹配 filler、五措辞交叉、信号检测分解)本身就是一套可以直接抄的测量模板。

局限与存疑

作者列的:报错 episode 降得更多这条「楔子」只在三个模型之一(Ministral)上稳稳成立;reasoning 臂只覆盖两个模型;50 条人工审计单人完成,没有一致性检验;预筛掉的两个 Gemma 候选方向相反,效应方向在模型族之间并不稳;只测了开源权重,没碰闭源 judge。

读下来的疑点:任务域只有数学过程验证,代码评审、事实核查这类更常见的审核场景没有外推证据;9%25% 的相对降幅说大不大,落到具体流水线会不会真的改变下游决策,取决于漏报比误报贵多少,论文没给这个权衡的分析。

术语

原文与代码

相关论文

全部论文解读