See2Think:多模态模型真的会用中间视觉状态推理吗?
Siyu Yan · hf · 2026-07-31
现有多模态大模型常利用草图、标注等中间视觉状态辅助推理,但缺乏对其真实依赖程度的深入评估。为此,研究者提出了 See2Think 评估框架,包含两部分:
- See2ThinkBench:包含 1200 个开放式、强依赖视觉的测试问题,覆盖 2D 结构、3D 场景和真实世界推理等 12 类任务。
- Visual Action-of-Thought (VAoT):用于记录模型在四种受控推理设置下的文本思考、视觉动作、渲染状态及后续推理过程。
实验发现,视觉推理高度依赖模型和环境,没有单一设置能在所有任务中占优。过程分析表明,模型通常能选择正确的视觉操作,但渲染保真度是最大瓶颈,且高反馈吸收率并不必然带来准确率提升。在受控干预下破坏任务相关反馈,模型准确率会下降超 10 个百分点,证明其确实依赖视觉状态。
「多模态」频道最新
- 海螺 H3 限时开放免费额度,Agent 视频生成降价并支持双开 — PrajwalTomar_ · 2026-07-31
- Pippit 推出 Story Studio:结合 Seedance 2.5 打造 AI 电影级连贯叙事 — HeyAmit_ · 2026-07-31
- Story Studio实测:用Seedance 2.5打造连贯AI长片 — HeyAmit_ · 2026-07-31
- ICLR 2026论文:TTT3R提升3D重建模型长度泛化能力 — rsasaki0109 · 2026-07-31
- AI将GTA圣安地列斯自行车追逐战变真人实景 — eyishazyer · 2026-07-31
- DeepSeek-V4-Flash多模态实测:生成3D模型不敌Gemini 3.6 — teortaxesTex · 2026-07-31