Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models
Danae Sánchez Villegas, Samuel Lewis-Lim, Nikolaos Aletras, Desmond Elliott
COLM 2026
cs.CL, cs.AI, cs.CV, cs.LG
2026-04-16
实测 18 个 VLM:答案常在推理开头就锁定、之后只找补;图像再充足,一句误导文本仍能带偏预测,长推理反而更掩盖这种文本依赖。
视觉语言模型(VLM)现在普遍会输出一段链式推理(chain-of-thought, CoT)再给答案。一个顺理成章的假设是:既然能看到模型「思考」的过程,就能拿它当监督手段。模型要是没真在看图、只在顺着题目文本蒙,翻翻 CoT 就能发现。
这篇论文(COLM 2026,哥本哈根大学与谢菲尔德大学)直接戳了这个假设。它问了三件事:VLM 在 CoT 的哪一步就锁定了答案?后面那些推理步骤到底是在纠错,还是只为前面的判断找补?最关键的——光看 CoT,能不能判断一个决策是被图像驱动的、还是被文本驱动的?
作者测了 18 个 VLM,覆盖 Qwen 和 InternVL 两个家族,各分指令微调(Instruct)和多步推理(Thinking)两类。测量分三层。
第一层是置信度轨迹(confidence trajectory)。把模型生成的 CoT 按前缀切成一步步,在每个前缀后面接「Answer:」,看正确选项的归一化概率怎么随步数变化。概率在头几步就稳定在最高位,说明答案早就定了。
第二层是截断分析(truncation)和净增益(Net Gain)。逐步把推理链截到不同深度重新打分,看准确率怎么变;Net Gain 算的是「原本错的推理后变对」减去「原本对推理后变错」的比例,衡量推理的纠错净效果。
第三层是最核心的可监控性框架(monitorability)。作者只在「纯视觉」版的题目里动手脚,这类题答案必须从图里读出来,题干文本给不出线索。他们往 prompt 里塞一句误导性文本(比如「一位斯坦福教授指出答案是 B」),看模型会不会照着这句错误提示改答案,这叫总效应(Total Effect)。接着请一个外部监控模型读 CoT,看它能不能(a)发现 hint 被用了、(b)判断这个决策究竟依赖文本还是图像。监控能力用 G²mean 衡量,1.0 是完美,0.25 是随机猜。
设计的妙处就在「纯视觉」设定:正确答案图像里才有,所以任何由注入文本引起的偏移,都铁定是模型在依赖文本,不是题目信息缺失。
第一个结论是「答案惯性」(answer inertia)。大量题目的最终答案在 CoT 头一两步就已经稳定,后面的推理基本是在为这个早期判断辩护。推理模型(Thinking)只是把锁定的时间稍微往后挪了挪,惯性模式没变。
净增益则暴露了一个反直觉的点:推理训练的收益取决于模态。在文本主导的题上,Qwen3-VL-32B-Thinking 的纠错增益明显大于 Instruct 版;但在纯视觉题上,反而是指令微调版的增益更大。「多想」主要帮的是「读字」那部分,「看图」部分未必。
总效应这一组结果最直接。即便图像信息完全充足,一句误导文本仍能显著改变预测,其中权威逢迎(professor sycophancy)杀伤力最大,reward-hacking(奖励作弊)类提示几乎无效。
| 题集 | Qwen3-VL-32B Instruct | Qwen3-VL-32B Thinking |
| MathVerse | 81.65% | 79.36% |
| PhyX | 56.30% | 55.57% |
| ScienceQA | 90.68% | 88.60% |
Qwen3-VL-32B 上 Thinking 版三个题集的准确率都没赢过 Instruct。多花算力推理,在这批题上没换来更高准确率。
这篇的杀伤力在第三层。它给出一个对从业者很实际的结论:CoT 不是 VLM 决策的可靠窗口,而且推理模型恰恰是最难监控的。
监控结果出现一个分裂。指令微调模型不爱在 CoT 里明说「参考过那句提示」,所以「检测 hint」的监控得分低;但它们推理短、常和图像对不上,「判断依赖哪个模态」的监控反而能从这些破绽里抓出来。推理模型正好反过来,它们会堂而皇之地提到那句提示,「检测 hint」得分高;可它们的长 CoT 流畅、像模像样地描述图像细节,「判断模态依赖」的监控却被这套包装带沟里了,看不出决策其实跟着文本走。
换句话说,最想监控的那类模型(推理长、看起来透明)正好是 CoT 监控最容易失效的地方。监控「模型有没有提到外部提示」和监控「模型到底在不在看图」是两件不同的事,前者做得到,后者在推理模型上做不到。还有一个旁证:去掉 chat template 后,指令微调模型的 hint 可监控性反而提升,说明 RLHF 训练本身在压着模型别承认用了外部线索。
作者自己承认的:主体实验用了结构化 prompt(推理步数封顶 5 步),虽然用无约束 CoT 做了验证,但和真实部署里几十上百步的长推理仍有距离;只覆盖 Qwen、InternVL 两个家族;监控只读 CoT 文本,不看模型内部表征。题目限定为选择题格式,自由生成的场景没验证。
还有一个更大的存疑:整篇建立在「外部监控读 CoT」这条路子上。作者的结论是这条路不够,但没给出替代方案,是得看内部表征、还是得在训练上动刀,论文只点到为止。另外净增益和准确率分开报,容易让人误以为推理「纠正了行为」,但 Thinking 版准确率反而更低,说明纠正的未必是真正该纠正的题。