From Atomic Evidence to Logical Composition: Structured Compositional Reasoning over Compound Answer Options
Obed Junias, Maria Leonor Pacheco
cs.CL, cs.AI
2026-08-13
把复合选项拆成原子、用对比假设打分并相对校准,再交给带运算符约束的整数规划求解;Llama-3.1-8B 上 LCQA 的 Macro-F1 从 48 升到 77,NEITHER/NOR 涨约 63 分。
大模型在逻辑推理上会失败,而且失败得不均匀。同样的常识知识,把两个判断用 AND 连起来模型还答得对,换成 OR 就下滑,换成 NEITHER/NOR 几乎全错。这篇把它定位成一个组合问题:模型能判断单个原子命题(atomic answer,复合选项里不能再拆的最小判断单元)对不对,却不会把它们按逻辑运算符拼回正确选项。作者把这个落差叫组合性差距(compositionality gap)。
这个排序不是 AI 独有。心理学的心智模型理论早就预测,合取(AND)只需要维护一个联合可能性,析取(OR)要把多个备选同时端着,否定还要额外记住原命题被否决,NEITHER/NOR 同时背上这两副担子,对人也是最难的。模型呈现的是同一道签名。
直接的提示方法把理解内容和逻辑组合揉成一次生成。模型既要判断每个原子,又要在同一步里按运算符组合,任何一环出错都无从归因,而让模型在自由生成里满足硬约束,它可以悄无声息地违反。
框架把流程切成三段:把选项拆成原子、对每个原子取证、把证据交给一个不能违反逻辑的求解器。
第一段,确定性地把每个复合选项解析成「原子1 运算符 原子2」三元组。一个原子只要在实例里出现过就只评一次,出现在多个选项里时,它的状态对这几个选项同时生效。
第二段,对每个原子构造一对对立假设:它满足当前上下文,或它不满足。把这两条假设作为 A、B 两个选项放进同一个提示,问模型哪个更合理,取首 token 的对数概率做归一化。让正反两面同框比较,比单独问「这句话对吗」更可靠。这一步只产生证据,不碰逻辑。
证据打分后还要校准。Platt 和 isotonic 这类标准校准只看分数绝对值。但每个实例恰好只有一个有效选项,一个原子能不能被选中,取决于它相对于同实例里其他原子的位次。作者新提出相对校准(relative calibration),特征向量包含实例内的标准化分数、排名、与最高分的差距,用逻辑回归映射回校准分数。
第三段是带逻辑约束的整数线性规划(ILP)。它给每个原子一个状态变量、每个选项一个有效性变量,用线性不等式把 AND、OR、NEITHER/NOR 的语义精确编码进去,再要求四个选项里恰好一个有效。目标函数是使被采纳原子的总证据最大。ILP 只做组合,只接受原子打分,而且不可能违反运算符语义。
实验全用 Llama-3.1-8B-Instruct,温度 0.7,五次平均,报告 Macro-F1。
| 评测集 | 最强直接提示 | 结构化推理 | 相对校准 |
| Logical-CommonsenseQA(人工校验) | 48.3 | 75.8 | 77.0 |
| Logical-SATA | 47.0 | 72.2 | 75.6 |
提升集中在最难的算符上。NEITHER/NOR 在 LCQA 上从 14.0 拉到 76.8,在 LSATA 上从 12.6 拉到 73.4,各涨约 60 分。AND 的提升小得多,因为模型本来就答得不差。这说明显式组合的价值,在需要处理备选、需要同时否决多个原子、或选项之间运算符不同时最大。
把推理层喂金标准原子状态,两个数据集准确率都是 1.00(由构造决定,每个实例恰有一个有效选项)。真正有意义的是原子错误穿透组合的量:原子准确率 0.830 和 0.824,组合准确率只有 0.758 和 0.723。校准层面,相对校准在两个数据集的 Brier 分数和 log loss 上都最好,且 log loss 降幅更大,说明原始分数是过于自信,而非单纯乱序。
这篇把「逻辑推理失败」拆成了可归因的两段:是原子判断错了,还是组合错了。标准提示做不到这件事。对从业者更实际的一点是,约束求解器保证最终预测严格符合运算符语义,自由生成里那种悄悄违反约束的错误在这里被堵死。
它给的证据指向一个判断:一部分被算作「模型不会推理」的失败,其实是「模型不会组合」。知识在,单个判断也对,组合那一步崩了。这把锅从知识储备挪到了推理管线。
代价是工程开销。每道题要构造多个对比假设提示、跑一遍校准、解一个 ILP,token 消耗和延迟都比直接提示高。它换的是可控性和准确率,不是速度。
整套评估只用了一个模型 Llama-3.1-8B-Instruct,换模型族、换更大的模型是否还成立,论文没有验证。运算符只覆盖 AND、OR、NEITHER/NOR,且每个选项固定两个原子,没有蕴含、异或、嵌套或更多原子。
两个评测集都强制「恰好一个有效选项」,真实任务常常允许多个正确答案或没有正确答案,这层构造性约束会高估方法的可用性。
ILP 在赋值时就丢弃了原子的不确定性,只给出单一选择。作者自己把这列为后续方向,想要一个能把原子不确定性传播到选项上的概率版本。
方法的天花板卡在原子证据质量上。常识的开放解读、阅读理解里的段落落地、源标注的错误,都会顺着逻辑约束传到最终预测。约束保证不了原子判断本身正确。