DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents
Huanyao Zhang, Jiepeng Zhou, Runhao Zhao, Yanzhe Shan, Jiaoyang Chen, Bowen Zhou, Bo Li, Fang Wang, Jialong Wu, Zhengwei Tao, Lang Mei, Xiaohan Yu, Liyan Liu, Chong Chen, Wentao Zhang
cs.CV, cs.AI
2026-08-03
把视觉从提问和作答两端推进到搜索中途,让获取的图像证据驱动后续检索,30B 开源模型十项基准平均 58.6。
多模态大模型(MLLM)的参数化知识是静态的,遇到知识密集、持续变化的开放世界问题就容易抓瞎。为此出现了「多模态深度搜索」:让模型在多轮交互里主动找外部证据。
但现有做法通常把视觉只在输入或作答阶段用一下,忽略了它在中间推理里的作用,也没为长链路交互专门设计。结果图像证据很少能推动后续的检索,交互深度和推理跨度都上不去。论文总结了三种既有范式:实体替换、前置裁剪、答案端嫁接,它们都是先用文本搭好推理链,图像只是点缀,中途拿到一张图很少成为后面某次检索的必要条件。
DeepVoyager-VL 是一个面向「视觉在环」(vision-in-the-loop)的长链路多模态深度搜索框架,分三块。
数据合成。先从维基百科和新闻里抽出实体与事件,规整成记录(参与者、关系类型、时间、地点),时空共现的合成「宏事件」,反复互动的实体对合成「关系束」,构成事件图。再给图里的节点配图,每张图存两类信息:检索上下文(用来重新定位它)和视觉内容证据(图里能撑起属性、计数、文字、对象、关系的事实),并刻意让检索上下文不泄露答案。
智能体框架。核心是把图像的「可发现」和「可观察」分开。搜索只返回轻量的「链接+ caption」引用,需要时用 FetchImage 把图真正拉进来、用 CropImage 切出可复用的局部观察,放进跨轮保留的视觉寄存器。动作集合包括文本搜索、图像搜索、反向图搜、访问网页、取图、裁图、跑代码。每次工具返回先用一个目标条件摘要器只留与目标相关的结论和图引用,避免上下文被原始返回撑爆。论文用反事实来强制「视觉在环」:一张新获取的图必须真正解掉后面某步需要的变量,否则这个问题不算需要视觉。
训练。只用监督微调,不上强化学习。按难度分层筛问题、用更强的教师模型生成轨迹,冻结视觉编码器和多模态合并层,只更新语言主干。
在十个多模态搜索基准上(MMSearch、SimpleVQA、LiveVQA、FVQA、BrowseComp-VL、MM-BrowseComp 等):
| 模型 | 直接作答 | 智能体工作流 | DeepVoyager-VL |
| 8B 平均 | 17.5 | 35.3 | 54.8 |
| 30B-A3B 平均 | 20.7 | 40.7 | 58.6 |
8B 版在十个基准里领先八个、30B 版领先九个(同等规模开源 agent 中)。和闭源模型比,30B 版在相同工作流下只差 GPT-5.5(67.2)约 8.6 分。框架层面的对比也成立:同样接 GPT-5、Gemini-2.5-Pro、Qwen3-VL-30B,DeepVoyager-VL 都超过 LMM-Searcher 等既有框架。消融显示去掉摘要器、图像搜索、取图、裁图任一项,平均都掉 2.5 到 4.0 分;在工具占比上,它的视觉工具调用占 64.3%,远高于对比方法的 10% 到 40%,印证了「视觉在环」不是口号。
对做 agent 和检索增强的人,这篇把视觉从「输入/输出装饰」提到了「推理链中间的一等公民」,并且用反事实必要性来逼模型真的用图,而不是顺手贴一张。数据合成的思路(事件图 + 反事实约束保证视觉不可省)也能迁移到别的需要多跳证据的 agent 训练数据构造。
作者承认:系统是面向「答题式搜索」设计的,没系统评估开放式目标分解、假设迭代、冲突来源比对、长文综述这类完整研究流程;目标条件摘要器每轮要调一个辅助视觉语言模型,带来额外延迟和部署成本,而论文没有刻画摘要质量、上下文压缩、延迟、成本之间的权衡;视觉工作记忆目前是累积式、轨迹局部的,不会学习哪些观察该留、该合并、该丢弃,交互一长就难免堆冗余。另外的存疑点:视觉在环的必要性是靠合成数据的反事实约束保证的,真实查询里这种「非看不可」的结构有多普遍,论文没给。