See2Think:多模态模型真的会用中间视觉状态推理吗?

Siyu Yan · hf · 2026-07-31

现有多模态大模型常利用草图、标注等中间视觉状态辅助推理,但缺乏对其真实依赖程度的深入评估。为此,研究者提出了 See2Think 评估框架,包含两部分:

实验发现,视觉推理高度依赖模型和环境,没有单一设置能在所有任务中占优。过程分析表明,模型通常能选择正确的视觉操作,但渲染保真度是最大瓶颈,且高反馈吸收率并不必然带来准确率提升。在受控干预下破坏任务相关反馈,模型准确率会下降超 10 个百分点,证明其确实依赖视觉状态。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →