因果审计揭穿视觉工具调用假象:多数裁剪调用无关最终答案

The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu

cs.AI

2026-08-07

因果审计六款多模态模型的裁剪缩放工具调用,发现准确率提升集中在一小撮校准得当的轨迹,多数调用其实不靠图像证据驱动答案。

这篇在解决什么

「thinking-with-images」范式让多模态大模型主动裁剪缩放图片、基于新图片继续推理,这两年被当作提升细粒度视觉理解的标准做法。但论文观察到一个反常现象:模型带着工具调用跑完一次推理,消耗的 token 是直接推理的数倍,换来的准确率提升却常常很小,部分题目甚至不如直接回答。已有研究注意到这个「边际收益悖论」,但停留在整体准确率层面,没有回答更根本的问题:模型返回的每一次裁剪图像,究竟有没有真的影响它给出的答案。

方法

论文把视觉工具调用画成一张因果图,把输入图像、问题、模型每一步发出的动作 Ti、返回的观察 Oi、最终答案 Y 串起来,区分出两类路径:一类是「观察介导路径」,裁剪图像的视觉内容真的传递到了答案;另一类是「动作诱导捷径」,单是发出了一次工具调用这个动作本身,就已经让模型更倾向于某个答案,和图里到底有什么无关。围绕这两类路径,论文设计了三层递进的干预:

结果

六款代表性模型(DeepEyes、Pixel Reasoner、Mini-o3、Qwen3-VL-4B/8B、Thyme)在 V、HR-Bench、VisualProbe、MME-RealWorld-Lite 上的策略级 ATE 差异巨大:

模型典型 ATE
DeepEyes接近 0(部分基准还是负的)
Pixel Reasoner / Qwen3-VL-4B / Thyme中等,多在 +3+7pp
Mini-o3 / Qwen3-VL-8B最大,VisualProbe 上分别达到 +21.3pp 和 +11.7pp

步骤级 VEG 揭示了这些差异背后的真实原因。DeepEyes 几乎所有调用的 VEG 都在零附近,连一条轨迹里表现最好的那次调用也没有实质贡献,说明它的裁剪动作从头到尾没真正被用来推理。Mini-o3 的调用大多信息量稀薄但偶尔能命中关键证据。Qwen3-VL-8B 的调用则高度依赖调用时机:模型置信度已经很高(概率差距超过 0.95)时再调用,增益被机械压到接近零。基于这些特征,论文构建了一个确定性分类器,把每条轨迹归到四组之一:无调用、Mode 1(Calling Without Looking,调用了但没真正看)、Mode 2(Looking Without Planning,看了但停不下来或调度混乱)、Calibrated(调用且真正用上了)。在 V 上分解策略级 ATE 后,几乎所有正向增益都来自 Calibrated 这一小部分轨迹,其余三组贡献接近零或互相抵消。

为什么重要

这篇论文提醒一个容易被忽略的事实:整体准确率上涨,不等于工具调用本身在起作用。如果只看聚合指标,很容易误判某个「看图」策略训练得不错,实际上模型可能只是学会了「调用工具会让人更放心」这种表面行为,而没有学会什么时候该看、看完该不该继续看。论文提出的假设是,当前主流的结果导向强化学习(只奖励最终答案对不对)天然会强化这种「调用了就有奖励」的捷径,却不会惩罚调用了但没用、或者调用了却停不下来的中间步骤。这个诊断工具可以直接用来筛掉没用的调用(推理时跳过 Mode 1)、给该停的轨迹加提前终止规则,或者把 VEG 当成过程级奖励信号去改造训练目标。

局限与存疑

论文的三层干预对模型访问权限的要求不同:策略级和轨迹级只需要能跑模型、能控制返回的观察,黑盒模型也适用;但步骤级 VEG 需要读取 token 级别的概率分布,只能在开源模型上做,论文没能验证 OpenAI o3/o4-mini 这类闭源模型是否有同样的模式。论文只研究了裁剪缩放这一种工具,OCR、视频关键帧选择等其他工具是否有类似的失配现象,论文承认没有验证。「结果导向 RL 导致策略失配」目前只是一个和观察一致的假设,论文没有做匹配训练信号的对照实验来证实因果关系,作者把这个留作后续工作。

术语

原文与代码

相关论文

全部论文解读