把一半测试时算力改花在证伪断言,自一致性最高再涨 12 个点

Claim-Level Reliability Assessment for Efficient Test-Time Reasoning

Sen Xu, Wei Wang, Shixi Liu, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong Chen, Junlin Zhang

cs.AI, cs.CL

2026-08-12

把测试时算力从多采样解答改花在证伪关键断言上,同预算下自一致性最高多拿 12 个点,GPT-OSS 上还省四成 token。

这篇在解决什么

自一致性(self-consistency)是测试时扩规模最常用的手段:同一道题采样 N 条解答,对最终答案投票。它的短板是投票只数人头不看质量,五条错得一致的轨迹能压过三条对的。改进方向要么靠 token 概率这类统计信号,要么单独训一个验证器,成本和适用面都受限。

微博团队这篇 COLM 2026 workshop 论文提出另一条路:把测试时算力的一半从「再多采样几条解」挪到「专挑关键断言去证伪」。训练无关,同一个模型既出解又当验证器。

方法

CLR 跑两阶段。第一阶段采样 K 条推理轨迹,每条在答案后附上恰好 M 条(默认 5)判决关键断言:解题路上那些一错就毁掉结论的中间命题,比如因式分解恒等式、素性判断。第二阶段把原题和这串断言(不给原轨迹、不给原答案)交给同一个模型,要求逐条找茬:与题设矛盾、断言之间冲突、隐藏假设、简单反例、计算错误,每条给出 VALID 或 REFUTED。

打分用非线性映射:轨迹得分等于存活断言比例的 M 次方。5 条断言存活 4 条,得分是 0.8 的 5 次方约 0.33;存活 3 条只剩 0.078。指数让被驳的关键断言比线性平均更致命。最后按答案等价类汇总轨迹得分,得分最高的组胜出,可靠的少数可以推翻错误的多数共识。

撑起整个方法的是一个不对称性:构造一个正确解需要整条推理链无懈可击,驳倒一条错误断言只需抓住一个致命漏洞。验证比生成容易,把算力换到验证侧才划算。作者明说这是归纳偏置,不保证证伪处处更容易。

预算对齐方式:CLR@K 用 K 次生成加 K 次验证,与 Cons@2K 调用数相同,主对比是 CLR@32 对 Cons@64。

结果

四个模型、四个数学基准(HMMT25/26、CMIMC25、Apex-shortlist),同 64 次调用预算:

模型(基准)Cons@64 → CLR@32 准确率token 变化
Gemma-4-12B-it(HMMT25)76.67% → 88.75%+33.4%
GPT-OSS-20B(CMIMC25)77.50% → 82.19%−37.0%
GPT-OSS-120B(CMIMC25)75.00% → 80.00%−21.6%
Qwen3.5-27B(CMIMC25)95.00% → 97.50%−2.5%

收益结构分模型。Gemma-4-12B 四个基准全部提升 7.12 到 12.08 个点,代价是 token 多花 22% 到 48%。GPT-OSS 两个型号在提分的同时省 21.6% 到 39.8% 的 token,GPT-OSS-20B 在 HMMT25 微降 0.42 点。Qwen3.5-27B 基线已过 90%,提升空间小,最多 +2.60 点。

消融把收益归因拆开了:让模型在解后面附断言这件事本身有害,单次 pass@1 反而降 0.65 到 4.56 个点;真正的收益来自第二阶段的证伪重加权,给同一批候选带来 +4.48 到 +7.01 点。

「救援率」量化翻案能力:自一致性投错、但候选里其实有正确答案的情形,CLR 纠回约 37%,16 个设定里从 16% 到 48%。断言数 M 从 1 加到 3 提 3.13 到 3.79 点,加到 5 在三个基准上继续涨,HMMT26 峰值停在 M=3。

为什么重要

对跑推理服务的人,这是不动模型权重就能换的聚合层:同样的调用预算,要么换准确率要么换 token。验证请求只含题目和几条断言,输出也短,这是 GPT-OSS 上 token 大幅下降的来源。跨预算曲线显示自一致性在加采样后会饱和波动,CLR 的扩展更平稳。

「用生成模型当自己的证伪器」这个思路不限于投票场景,Best-of-N 的重打分、搜索里的剪枝都能挂。

局限与存疑

方法只重加权已采样的候选,正确答案不在 K 条样本里就救不了,它做的是选择不是覆盖。实验全在数学基准上,断言提取 prompt 也是纯数学模板,迁移到代码、事实推理还没验证。作者承认非线性打分是启发式,不假设断言独立;M 同时控制语义覆盖和指数锐度,消融没法把两者分开。中间预算区间两种方法的曲线会交叉,CLR 不在所有操作点占优。Gemma 上 token 反而多花三分之一,省算力这点并不普适。

术语

原文与代码

社区讨论

相关论文

全部论文解读