CausalVLBench:因果图能画到 100%,干预的连锁反应却跌到 50-60%

CausalVLBench: Benchmarking Visual Causal Reasoning in Large Vision-Language Models

Aneesh Komanduri, Karuna Bhaila, Xintao Wu

EMNLP 2025 Main)

cs.LG, cs.AI, cs.CL

2025-05-21

9 个 LVLM 在三个物理系统上做视觉因果推理。因果图好画(钟摆 100%),干预目标预测集体翻车,反事实靠预测初始值刷分,真传播时掉到 50-60%。

这篇在解决什么

LVLM(大型视觉语言模型)在图文问答、识别上已经很能打,但「因果推理」这块一直没人系统测过。文本侧早有结论:大模型在 Pearl 因果阶梯(Pearl's Causal Hierarchy)的 L1 观测问题上答得很好,L2 干预、L3 反事实就力不从心。可这是纯文本测出来的。换到视觉,给一张图,模型能不能看出「哪个变量动了、谁影响了谁、如果改一个值结果会怎样」,此前几乎是个空白。

已有的视觉因果评测(比如 CELLO)只看「人和物体的场景关系」,不碰真正的因果机制。作者补的就是这块:一套基于物理系统、因果机制确定可验证的视觉因果基准。

方法

基准叫 CausalVLBench,由三个因果表征学习数据集改来,都只有 4 个因果变量:

每个数据集 40% 当支持集(给 in-context 学习的例子)、60% 当查询集,每轮随机抽 1000 题。

三个任务对应 Pearl 阶梯的三层:

测了 8 个开源模型(从 LLaVA-OneVision-7B 到 Qwen2.5-VL-32B)加一个闭源 Gemini-2.0-Flash。作者明说:因为算力,没测 GPT-4V 和 Claude。

结果

因果机制最「物理」的钟摆最简单。Qwen2.5-VL-32B 和 Gemini 都在标准设置下画出 100% 正确的因果图(SHD=0)。换到人造的电路,最高准确率掉到 73.2%(Gemini),SHD 升到 3 左右。

任务(零样本,Gemini)钟摆水流电路
结构推断准确率100%91.6%73.2%
干预目标 0/8-shot39.4 / 47.437.6 / 55.710.5 / 66.1
反事实 0/8-shot83.4 / 86.580.3 / 88.397.0 / 97.4

干预目标预测是真正的难点。需要看图对的任务里模型集体翻车,很多模型加更多示例反而更差。Gemini 在电路上从零样本 10.5% 涨到 8-shot 66.1%,是少数能从 in-context 学习里获益的;多数开源模型加 shot 就崩。

反事实的数字看着高,作者自己拆穿了水分:模型靠「预测成初始状态」刷分,并没有真的把干预传播到下游变量。一旦干预目标有后代节点(比如改了光源,影子该跟着变),准确率掉到 50-60%;只有动叶子节点时才答得好。

链式思维(CoT,Chain-of-Thought)提示效果很分裂:Qwen2.5 在电路结构推断上从 54.8% 跳到 98.5%,但 Gemini 加了 CoT 反而变差,长推理链让它失焦。

为什么重要

它给视觉模型划了一条清楚的能力红线:认得出「相关」和「会推因果」是两回事。结构推断能靠模式匹配蒙过去,钟摆这种见得多的物理现象尤其好蒙;但干预和反事实要求模型真懂「动了 X 会怎样」,这块当前没有一个模型过关。

对做评测和做 Agent 的人,这个基准把「多图推理」和「反事实传播」两个具体短板钉死了。如果你的应用要模型看监控画面判断「改了哪个阀门会导致什么」、或从医学影像推「换一种治疗方案会怎样」,当前 LVLM 还撑不起来。

它也是一记方法学警钟:反事实任务上 80% 以上的表面准确率,可能是「偷懒答初始值」堆出来的。做评测的人得设计能区分「真传播」和「复读」的指标,作者用的「按干预节点有没有后代拆开看」就是这种思路。

局限与存疑

术语

原文与代码

社区讨论

相关论文

全部论文解读