When to Trust the Cheap Check: Weak and Strong Verification for Reasoning
Shayan Kiyani, Sima Noorani, George Pappas, Hamed Hassani
cs.LG, cs.AI, stat.ML
2026-02-20
宾大提出SSV:用弱校验分数的双阈值决定接受、拒绝或升级。数独准确率43.1%接近Oracle的44.2%,强校验从每盘5.32次降到2.87次。
推理系统里的校验分两层。一层便宜、能铺开:self-consistency、proxy reward、LLM-as-judge、代码执行这类局部检查,论文叫 weak verification。另一层贵:人逐行看、领域工具跑一遍、或更强模型对照标准答案,叫 strong verification。便宜的噪声大,贵的扩不起来。
现有工作走两条路。一条把弱信号当固定物,在上面做搜索、采样、更长思维链;另一条把弱校验本身训得更准,比如 process reward model。缺的是上一层调度:弱分数到什么程度可以直接信,什么时候必须请贵校验。宾夕法尼亚大学这篇把调度形式化成 weak-strong verification policy,并给出在线算法 Selective Strong Verification(SSV)。
问法很具体。强校验如果每步都请,可靠性能到多少;能不能只在一小部分步骤请,还把可靠度对上。
设定干净。语言模型给出回复 R,弱校验打一个 [0,1] 分数 w,强校验给 0/1 对错 g。策略根据 w 选三个动作之一:直接接受(A)、直接拒绝(R)、或调用强校验(SV)。查询流可以是完整答案(outcome-level,对应 ORM),也可以是逐步推理(process-level,对应 PRM),还可以任意依赖历史,论文对生成过程不做分布假设。
评三个量。Type-I 是在 g=0 的回合里错误接受的比例,错的被放行。Type-II 是在 g=1 的回合里错误拒绝的比例,对的被砍掉。SV 频率是调用强校验的比例。前两个是质量,第三个是成本。三者不能同时压到零:要 Type-I/II 足够小,往往就得多请强校验。
人口层面,若弱分数对强校验校准(w=p 时正确概率就是 p),最优策略是双阈值:w 太低直接拒,太高直接收,中间模糊带才请强校验。弱校验好不好看两件事。calibration 让分数能当概率读;sharpness 让分数经常贴 0 或 1。永远输出边际正确率的校验器校准完美,但没有实例信息,sharpness 为零,策略只能天天请强校验。
顺序场景里分布未知,校准假设也不再需要。SSV 维护两个自适应阈值 τR ≤ τA:
阈值只在看到 g 时更新,用 importance weighting 修正随机抽检。随机抽检是必须的。高分区如果永远不看 g,Type-I 爆了算法自己不知道。Theorem 5.1 给出分布无关、对任意时刻 T 都成立的有限样本界:Type-I ≤ α 加一项 slack,Type-II ≤ β 加一项 slack。slack 随样本量、步长 η、最小抽检概率 qmin 走,结构跟 online conformal 和 quantile tracking 同类。
这套东西和 selective prediction、learning-to-defer 是亲戚:defer 在这里就是请强校验。差别是在线、部分反馈、Type-I 和 Type-II 分开控。
两条任务。MATH 是 outcome-level:GPT-4o-mini 写完整解答,DeepSeek-Chat 打弱分,GPT-4o 对照标准答案做等价判断当强校验,测难度 2/3/5。Sudoku 是 process-level:4×4 迷你盘一步一格,生成器和弱校验同样,强校验改成程序对标准解的确定性检查。基线两端是 Strong-Only(每步请强校验)和 Weak-Only(best-of-n 只信最高弱分)。
误差控制先过关。α=β=0.15 时,两条任务的 running average Type-I/II 都贴着目标稳住。附录里换 0.05/0.10/0.20 同样贴,MATH Level 5 在 α=β=0.05 时最终 Err A/R 是 0.047/0.047。
成本对准确率:
| 方法 | 准确率 | 强校验/题 | 弱校验/题 |
| Sudoku Oracle | 44.2% | 5.32 | 未报 |
| SSV α=β=0.01 | 43.1% | 2.87 | 5.19 |
| SSV α=β=0.10 | 39.0% | 1.24 | 5.18 |
| Sudoku Weak-Only | 33.6% | 0 | 6.00 |
| MATH L5 Oracle | 63.5% | 2.8 | 未报 |
| MATH L5 SSV | 60% | 2.0 | 未报 |
Sudoku 上 α=β=0.01 时准确率只掉 1.1 个百分点,强调用少 46%。MATH 最难一档弱信号糊,曲线接近线性:2.0 次换 60%,Oracle 2.8 次换 63.5%。附录 Table 8 解释了为什么:Easy 的 AUC 0.88、正确与错误均值差 0.57;Hard 掉到 AUC 0.74、差值 0.37。sharpness 均值从 Easy 的 0.467 掉到 Hard 的 0.358。容易题曲线陡,难题就得按比例加钱。
Sudoku 还有一个副作用。Weak-Only 每盘 6.00 次弱调用,SSV 各操作点落在 4.8 到 5.2。阈值会提前接受或提前升级,少做几轮没信息量的弱打分。
做推理系统的人一直在两头之间拍阈值:全信 LLM-as-judge 会漏错,步步请 GPT-4o 或人又太贵。SSV 把拍阈值变成两个可调旋钮 α、β,并且给出有限样本保证,不需要对查询流、模型或弱校验做分布假设。
能用的场景很具体:best-of-n 数学、逐步 PRM、任何「有廉价分数、偶尔能拿到金标」的管线。弱校验 sharpness 高时收益最大。Sudoku 这种几乎砍半强调用、准确率只掉 1.1 个百分点。弱校验糊的时候它不会创造信息,只会老实地多请强校验。
这是调度层,不是更好的 verifier。弱校验差,SSV 帮不了多少。部署时最痛的往往就是这一层:钱花在哪一步。
论文自己写了:决策只看弱分数 w,不看 prompt-response 上下文,误差控制是边际平均,不是条件于具体题目类型。上下文相关阈值留到以后。
实验里 MATH 的强校验是 GPT-4o 做答案等价,金标路径经过了另一个 LLM。Sudoku 是 4×4 不是 9×9,Oracle 准确率也只有 44.2%,生成器本身弱。省的是校验次数,不是把解题能力抬上去。对照只有 Weak-Only 和 Strong-Only,没有和其他 learning-to-defer 或 conformal 方法比。探索概率 qA、qR 本身会多耗强调用,论文没给出一套默认选法。
保证控的是「在本该错或本该对的回合里,策略跟强校验不一致的比例」,不是终端用户看到的最终正确率。最终准确率还取决于生成器、采样预算 n、以及被拒之后会不会再采样。