18 个 VLM 实证:CoT 推理中模型固守初始答案难自我纠错
delliott · x · 2026-10-06
哥本哈根大学团队(论文作者 Danae Sánchez Villegas、Desmond Elliott 等)在 COLM 2026 发表论文,分析 18 个视觉语言模型的推理动态,覆盖指令微调与推理训练两类、两个模型家族。
核心发现:
- 答案惯性(answer inertia):模型在思维链(CoT)推理过程中倾向于强化早期预测,而非修正;开源权重 VLM 在 CoT 中基本不会 revise 已作出的预测。
- 推理训练模型表现出更强的纠错行为,但其收益随模态条件(文本主导到纯视觉)变化。
- 用误导性文本线索做受控干预:即使视觉证据充分,模型仍持续受文本线索影响;推理训练模型更可能在 CoT 中显式提及线索,但其更长更流畅的 CoT 可能表面上「视觉有据」、实则跟随文本线索,使监控更难检测。
- 这种影响的可检测性因模型和监控对象而异。
论文对「通过 CoT 监控模型是否依赖正确模态」这一安全监控思路给出了能力边界。
「研究」频道最新
- 讨论:即使 ω=2,O(n²) 矩阵乘法几乎必然不成立 — basedjensen · 2026-10-06
- Cohere 发布 Tiny Aya 多语言小模型家族,支持 70 余种语言 — Cohere_Labs · 2026-10-06
- 当 AI 改写 O(n²):优雅数学定理会被 LLM 逐一打破吗 — teortaxesTex · 2026-10-06
- ETH 团队 AME-2 四足步态论文被 TRO 接收,开源 G1 训练代码库 — ChongZzZhang · 2026-10-06
- 0.8B 模型闭式权重手术跑赢 2B 模型,ARC-Challenge 达 42.15% 零反向传播 — AdventurousTwo6445 · 2026-10-06
- MIT 团队发布科学任务分类法:覆盖 232 子领域、20.8 万项任务 — JMateosGarcia · 2026-10-06