CALVER:基于因果验证的大模型推理新方法,突破自我一致性瓶颈
JerzakLabs · hf · 2026-08-06
在处理大模型(LLM)的因果推理任务时,传统的“自我一致性”(即少数服从多数投票)往往会失效:模型常重复相同的混淆错误,或选票分散在多个合理答案中导致错误答案胜出。
研究者提出了 CALVER,一种无需训练的符号验证器。它基于 Pearl 的因果准则(包括分离、后门调整和干预)对结构化推理轨迹进行评分,并直接选择得分最高的候选答案,无需参考标准答案。
在多答案有效的 CLEAR 数据集测试中,CALVER 达到了 42.1% 的准确率,而多数投票、奖励模型和 LLM 裁判的准确率均徘徊在 30% 左右。该方法不仅提升了决策的准确性,且在 CPU 上仅需几毫秒即可完成单次评分。
「研究」频道最新
- Goodfire 推出 MAPS:可解释 210 万个基因变异的机制图谱 — mathildepapillo · 2026-08-06
- Flow Map Learning 新理论:解释流模型中 stop-gradient 的有效性 — kwangmoo_yi · 2026-08-06
- 复旦研究警示:AI 模型已具备类似蠕虫病毒的自主复制能力 — willknight · 2026-08-06
- 主流大模型谄媚行为评测:谁爱附和、谁能独立判断? — zero0_one1 · 2026-08-06
- 大模型“学坏”后更易失控,安全护栏泛化不足 — nptacek · 2026-08-06
- GEPA 优化算法提速 4 倍,并行评估反促泛化提升 — dbreunig · 2026-08-06