多个答案都对时投票会输:CALVER 用因果符号校验把准确率拉到 42%

When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs

Omatharv Bharat Vaidya, Connor Thomas Jerzak, Zayne Rea Sprague, Fangcong Yin, Nhat Ho

cs.AI, stat.ML

2026-08-04

Self-consistency 投票假设最高频答案最可靠,但在因果推理里有效答案会分散、错误答案反复重复而胜出。CALVER 是个免训练的符号校验器,用 Pearl 的因果准则给每条采样推理打分,在 CLEAR 多有效答案题上拿到 42.1%,而 plurality、奖励模型、LLM 裁判都卡在 30% 左右。

这篇在解决什么

Self-consistency(自洽性投票)是大模型推理的常用招:采样 K 条思维链,取出现最多的答案。它背后有个假设,最高频的答案最可靠。这篇指出这个假设在因果推理上系统性失效,有两种失效方式。一是同一个混淆错误被反复采样到,错误答案成了众数;二是正确答案本身有好几个(比如满足后门准则的调整集有好几个),有效票被分散,结果一个无效答案靠着是最大单一模式而胜出。论文举的例子:有效概率质量 0.70 分散在 7 个字符串上,而无效答案 ∅ 作为单一最大模式赢下投票。

方法

CALVER(Causal Axiom-Level VERification)是个免训练的符号校验器,不改模型,只改「从 K 条采样里选哪一条」这个环节。它让模型把推理写成六个槽位的结构化 trace:图、查询、策略、推导记录、计算结果、答案。然后用六个确定性二元检查给每条 trace 打分。

得分最高的那条 trace 被选中,取最早达到最高分的。整套检查用 Pearl 的因果图准则(d-separation、后门调整、干预)在 CPU 上毫秒级跑完,不需要参考答案。

结果

主战场是 CLEAR 数据集里那种「有多个图上合法答案」的 find-one-valid 题。同一批冻结的采样池上:

选择方法准确率
Plurality(取众数)约 30%
奖励模型 Skywork V2 8B30.5%
LLM 裁判 Qwen2.5-72B约 30%
模型自身置信度约 30%
CALVER42.1%

把裁判放大到 72B 也追不上 CALVER。按模型拆看,Qwen-14B 上 CALVER 把 44.4% 拉到 68.5%(+24.1pp),Mistral NeMo 12B 从 28.3% 到 47.4%。随采样预算 K 增大,优势还拉宽:K=2 时领先 7.7pp,K=32 时领先 25.4pp。在一组人工审计的 clean-core 子集里,CALVER 选中的 21 个图上合法答案里有 11 个和 benchmark 标准答案不同,但都满足题目谓词,说明标准答案从来不是唯一对的,按它计分本来就不公平。

迁移性也好:在 10 个 bnlearn 贝叶斯网络上,plurality 39.8% 到 CALVER 56.8%;让模型从自然语言文本里自己构建因果图的三档难度(L1/L2/L3)上分别 +24.2/+14.2/+17.6pp;在 K&K 逻辑谜题上,3 人局 50% 到 77%、5 人局 22% 到 38%。在 576 个至少含一条有效 trace 的池子里,无效答案靠众数赢的有 226 个,CALVER 修回 197 个,误改 54 个,净赚 24.8pp。

为什么重要

best-of-K 是推理时放大模型能力最便宜的手段,但在「答案不唯一」的任务上,投错票的锅不在模型,在投票机制。CALVER 给这类任务提供了一个不重训、几乎零成本(毫秒级 CPU)的选择层。它的适用边界也清楚:当答案近乎唯一时,best-of-K 本来就够;当文本到图的抽取很可靠时,直接抽取一次再精确求解更好。CALVER 占的是中间地带,答案合法的有很多,又没有哪次抽取靠得住。

局限与存疑

优势是有边界的,作者承认:答案近乎唯一时不需要它,抽取可靠时直接求解更优。它还有个硬前提,题目要能用图计算算法判定合法性,也就是因果结构要能形式化;对开放域、无法写成因果图的推理,这套方法不适用。一个读下来值得追问的点:CALVER 在「先抽取文本再求解」(extract-then-solve)的对照里并不总赢。在可执行子集的 L1/L2 上,直接抽取求解能做到 92.8%/96.7%,CALVER 只有 83.7%/82.4%。当抽取这一步本身够准时,绕开符号校验直接算反而更准,CALVER 的甜区确实只在抽取不可靠的中间地带,论文对此是诚实的。

术语

原文与代码

相关论文

全部论文解读