See2Think: Do Multimodal Models Really Use Intermediate Visual States?
Siyu Yan, Zhuoran Yan, Haiying Xu, Panhao Zhou, Jingyu Chen, Chenhao Ji, Shuo Cao, Yongheng Zhang, Haoze Liu, Siyu Zhang, Xiwen Gu, Yihao Liu, Alex Jinpeng Wang
cs.CV, cs.AI
2026-07-29
See2Think 发现多模态模型「选对动作但渲染不忠实」;篡改返回的视觉状态让 3D 场景推理掉 15.5 个点,模型确实依赖这些图,但正确渲染净收益很小。
近两年多模态模型流行起「看图思考」(thinking with images):解题时不止看原图,还会画辅助线、圈出区域、裁剪放大,甚至调用工具生成中间图,再据此往下推理。问题是,这些中间视觉状态到底是模型推理的依仗,还是只是好看的装饰?之前的视觉推理基准几乎都只对最终答案打分,顶多评一下轨迹画得像不像,没人回答得了「模型后面那步推理,真的用到了它自己刚画出来的那张图吗」。See2Think 要把这个「真用 vs 装样子」拆成可测量的东西。
框架分两半。See2ThinkBench 是数据面:1200 道「非看图不可」的开放题,覆盖 12 个类别,横跨 2D 结构化(几何、空间谜题、物理、化学等)、3D 场景、真实世界(机器人操作、直觉物理等)三档。构造时刻意滤掉了「光看文字描述就能蒙对」的题:用强模型给图配详细 caption,再把原图藏起来只给 caption 让另一个模型答五次,答对三次以上的题直接踢掉,留下来的才是真需要看图的。
真正核心的是 VAoT(Visual Action-of-Thought)协议。它把推理过程记成交替的「文字思考→视觉动作→渲染出的新图→基于新图继续推理」的闭环,并设了四种受控设置做对照:
这套设计的关键在于把过程拆成三个可打分的维度:动作相关性(画的圈、画的线是不是冲着解题关键去的)、渲染保真度(渲染器有没有忠实执行那个动作)、反馈采纳(后面的推理有没有真用上图里的信息)。再加一个篡改干预,就能区分两个长期被混为一谈的概念:「视觉状态有用」(正确渲染能不能涨分)和「模型依赖它」(篡改会不会掉分)。
四个模型(GPT-5.5、GPT-o3、Gemini 3.5 Flash、Qwen3-VL-32B-Instruct)在全部 1200 题上跑四种设置,结论很反直觉:没有一种设置通吃。GPT-5.5 和 Qwen3-VL-32B 用纯 CoT 最强,GPT-o3 反而 VAoT(真渲染)最强,Gemini 3.5 Flash 是 VAoT-NoRender(只规划不渲染)最强。视觉思考是不是帮忙,取决于具体模型和具体任务。
过程诊断才说清了为什么。动作相关性四个模型都接近满分(整体 0.96 到 0.99),模型基本都能选对该看哪儿;渲染保真度只有 0.6 上下,卡在这一档。瓶颈不在选动作,卡在渲染准不准、画完用没用。最典型的是 3D 场景:答对和答错的轨迹,渲染保真度差距最大(0.097),远大于动作相关性差距(0.011)。
| 维度(整体均值) | GPT-5.5 | GPT-o3 | Gemini 3.5 Flash | Qwen3-VL-32B |
| 动作相关性 | 0.985 | 0.978 | 0.976 | 0.958 |
| 渲染保真度 | 0.616 | 0.614 | 0.630 | 0.594 |
| 反馈采纳 | 0.772 | 0.830 | 0.694 | 0.871 |
最有意思的发现来自篡改实验。把返回的图悄悄改坏,反馈采纳分越高的样本,准确率掉得越多;在 3D 场景里,反馈采纳从 0 升到 1,篡改导致的准确率落差从 3.5 个点一路涨到 15.5 个点。四个模型里有 32.7% 到 54.2% 的样本,仅仅因为换了张被篡改的图,最终答案就变了。但与此同时,正确渲染(VAoT)相对不渲染并没带来对等的净涨分,常常还更低。模型确实在依赖这些视觉状态,但这种依赖帮不到多少忙,更多时候是「用错了也照用」。
这篇对从业者的价值不在哪个模型分数高,而在它给「看图思考」这件事立了一套可干预的诊断方法。如果你在做会调用视觉工具的多模态 agent,光看最终准确率涨没涨是看不出门道的,很可能模型只是「看起来在用图」。See2Think 提供的两个拆分很实用:把瓶颈定位到渲染和反馈环节(动作选择基本不是问题),并用「有用」和「依赖」两把尺子分开量。对做视觉工具、image-editing 渲染器或 process reward 的人来说,「渲染保真度」是个值得单独优化的硬指标。
作者自己列了三条:只测了四个模型,代表性有限;过程打分靠外部渲染器和 GPT-5.4 自动评判,虽做了人工校验(240 条轨迹,合理或部分合理率 92.9% 到 96.9%)仍可能引入误差;WrongRender 篡改的效果大小取决于篡改质量,人工审计里「严格通过」的只占 56.7%,所以那个 15.5 个点的落差只能看成量级、不是精确值。
还有一处存疑:四种设置里最强的总是 CoT 或 NoRender 这种「不真渲染」的,真把图画出来(VAoT)几乎从不占优。这等于在问当前的外部渲染器够不够好。如果换一个更可靠的渲染或执行后端,VAoT 的净收益会不会上来?这篇没拆这个变量,留给后人。