DeepVoyager-VL:无需强化学习打造长程多模态深度搜索智能体

Huanyao Zhang · hf · 2026-08-04

现有多模态大模型在处理开放世界动态问题时受限于静态参数知识,而现有的多模态深度搜索方法通常只在输入或回答阶段使用视觉,忽略了其在中间推理环节的作用,限制了交互深度。

为此,研究者提出 DeepVoyager-VL,一个面向长程多模态深度搜索的视觉闭环框架。其核心机制包括:

在十个多模态搜索基准上的实验证明了该方法的有效性。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →