反直觉发现:视觉推理靠工具调用文本而非图像像素
kwangmoo_yi · x · 2026-08-14
论文《Thinking With Tools, Not With Pixels》对视觉语言模型的“思考”机制提出了反直觉的结论。
- 核心发现:在工具增强的视觉模型中,直接跳过或移除返回的图像像素,不仅不会导致性能明显下降(VBench 仅降低 0.52 个百分点),在 MathVista 上甚至能提升表现。
- 机制解释:研究者提出“工具调用文本支架”假说。模型在调用 crop 或 zoom 等工具时生成的结构化文本(包含工具名、坐标、目标描述等),已经隐式编码了“看哪里”和“找什么”的因果信号。
- 结论:真正驱动视觉推理的是工具调用过程中的文本规划,而非返回的图像像素本身。
所属事件:研究称视觉推理跳过看图直接用工具性能反升(2 条相关)→
「多模态」频道最新
- AI图像生成太强,大品牌广告已开始采用 — Vjeux · 2026-08-14
- RTX 5090 跑 H3 模型对口型:30 秒视频耗时 12 分钟 — R34vspec · 2026-08-14
- 探讨 AI 视频片段无缝拼接:如何消除转场运动卡顿 — PizzaLater · 2026-08-14
- AI 现实秀突破:fAIkout 推出 20 分钟长视频 — AIandDesign · 2026-08-14
- 实测 MiniMax H3:双片段链接生成 30 秒连贯故事 — GamerVick · 2026-08-14
- Seedance 2.5 实测:30秒一镜到底的 FBI 突击执法视角视频生成 — techhalla · 2026-08-14