OneSearch-VL: Unified Multimodal Deep Research Agent for Image and Video
Hongyu Li, Manyuan Zhang, Kaituo Feng, Shu Chen, Dian Zheng, Hao Li, Hao Yu, Zhangquan Chen, Zoey Guo, Ray Zhang, Shaofei Huang, Tianrui Hui, Linjiang Huang, Si Liu
cs.CV
2026-10-09
视觉锚定证据图把锚点、网页事实和作答运算收在一起,训出的 OneSearch-VL-8B 在多图与视频深研上比带工具的 Qwen3-VL-8B 高 20.2 和 17.6 个点。
单图要裁局部,多图要在若干张图之间对齐实体,视频还得先找到时间段。deep research 在这里指多轮工具调用:先在画面里定位,再检索网页,把有出处的事实拼成答案。
视觉动作不同,工作流却是同一条。已有记录经常只保住半段。感知到知识的链条、事实 rubric、一般证据图,都没有同时留下从框或帧到实体、到带来源的事实、再到作答运算的依赖。视频管线多把实体或关键帧当成检索种子,题目生成之后出处就断了。定位、检索和组合分别错在哪一步,后面的评测拆不开。
OneSearch-VL 用一个策略覆盖这三类输入。北航牵头,合作者来自港中文、NTU、清华和合工大。造题、滤轨迹、过程奖励和按运算评测,挂在同一份任务级参照上。
这份参照叫 VGEG(Visually Grounded Evidence Graph,视觉锚定证据图)。一条视频先收成输入级图,节点是事件、关键帧、检测框和网页实体。每个问题再做一次投影,只留下该题用到的锚点、带来源的事实,以及这些事实如何变成答案。单图不重新采集,把 OpenSearch-VL 里的维基实体路径转成同一种图。
视频侧从 250 万条 YouTube 记录筛到 70,781 条。上传日从 2023 年起,再做元数据、类目配额和时长平衡,并用 GPT-4.1 看标题和简介是否适合外部知识题。音乐、教育等类目被去掉,可检索实体太少。画面按 2 FPS、十帧一段采样。Seed 2.0 Pro 写描述并提议实体,Qwen3-VL-Embedding 去掉图像相似度不低于 0.9 或文本相似度不低于 0.8 的重复帧,片段收成事件后由 Qwen3-VL-30B 打框。框走以图搜图,或先 OCR 再文本检索,Qwen3-32B 核对网页。每条事实保存头尾实体、关系、URL 和引文,并沿置信度不低于 0.5 的后继往下扩展。
出题时用选定证据重答一遍,对不上就丢。实体真名改成只能靠画面指认的说法,纯文本探针能答对的题删除。多图题把去重关键帧打乱,帧号改成图像下标。
专家轨迹仍由 Seed 2.0 Pro 在真实工具环境里滚出,标准答案不给它看。GPT-4o 判最终答案,过程规则要求至少一次有效工具调用。留下的轨迹平均 10.1 轮。SFT 集 OneSearch-VL-SFT-110K 约 11 万条:单图 3.6 万、多图 3.7 万、视频 3.5 万。RL 集 OneSearch-VL-RL-10K 约 1 万题:单图 3.7k、多图 2.8k、视频 3.6k。基座对每题采样 8 次,只留答对 1 到 7 次的题。
工具协议相同。视觉侧是裁剪、OCR、透视校正、超分和锐化,检索侧是以图搜图和文本搜索,视频另加选时间段和抽帧。SFT 从 Qwen3-VL-8B 全参更新语言模型,冻住视觉编码器和投影层。损失只打在推理、工具指令和最终回答上,工具观察不作拟合目标。RL 用 GRPO:同一题采样一组轨迹,按组内奖励的相对高低更新。
总奖励是格式门控下的加权和:答案正确性 0.6,查询质量 0.2,EVGR 0.2。EVGR(Evidence-aware Visual-Grounded Rubric reward)用该题的 VGEG 当评分表,分两次判。证据可追溯看观察有没有撑起所需事实,视觉锚定看有没有用对物体、区域或帧。单图和多图的原图已经在上下文里,不强制再调视觉工具。视频必须抽到相关时刻,并且后续检索使用的是该帧上的身份。工具中途失败时,只训练失败前还有效的前缀。
评测按最后一步运算切开,不按题材切开。OneSearch-MI-Bench 301 题,OneSearch-Video-Bench 307 题,合计 608。单锚点查找占 8.7%,五种组合运算占 91.3%。多图题每题 2 到 8 张,平均 3.05 张。自动过滤之后有人工核对锚点、出处和运算标签。
最终答案由 GPT-4o 做二值判断,工具环境与训练时相同。
七个单图深研基准平均 58.3。带工具的 Qwen3-VL-8B 为 42.0,本模型高 16.3。OpenSearch-VL-8B 为 56.6,本模型高 1.7,且七项都更高。正文点名的差距是 VDR +2.8(23.6 对 20.8)、InfoSeek +2.1(72.3 对 70.2)、MMSearch +2.0(66.5 对 64.5)。同表 agent 里它拿下六项,MMSearch 上 SenseNova-MARS-8B 为 67.4,高于 66.5。VDR 和 BrowseComp-VL 仍然难,只有 23.6 和 39.0。
多图新基准、视频新基准和 VideoDR 上,正文写的提升是 20.2、17.6、27.0 个点,对照都是带工具的 Qwen3-VL-8B。消融表绝对分是 55.8、35.5、57.0,同表基线是 35.5、17.9、30.0。VideoDR 上 OpenSearch-VL-8B 为 47.0。组合运算拉开的差距更大:多图的知识条件计数、多锚点算术、多锚点比较分别高 29.8、26.3、22.5 个点;视频的多跳检索、多锚点算术、多锚点拼接分别高 25.5、20.0、19.2 个点。
| 对照 | 指标 | 结果 |
| vs 带工具 Qwen3-VL-8B | 七个单图平均 | 58.3 vs 42.0(+16.3) |
| vs OpenSearch-VL-8B | 七个单图平均 | 58.3 vs 56.6(+1.7) |
| vs 带工具 Qwen3-VL-8B | 多图 / 视频 / VideoDR | +20.2 / +17.6 / +27.0 |
| 消融表绝对分 | 多图 / 视频 / VideoDR | 55.8 / 35.5 / 57.0 |
| 三类联合 SFT | 六基准平均 | 55.8,单类型 51.7 到 55.1 |
| 答案+查询再加 EVGR | 六基准平均 | 57.3 到 61.1 |
六基准是 SimpleVQA、InfoSeek、FVQA、两个新基准和 VideoDR,与上面七个单图平均不是同一列数字。相同迭代数下,只训一种输入就能把六基准平均从 40.7 抬到 51.7 到 55.1,只训视频最高,到 55.1。视频轨迹把 SimpleVQA 做到 68.6,高于只训单图的 66.1,另外两个单图基准也更高。三类联合为 55.8,只比纯视频多 0.7,并在 SimpleVQA(68.7)、多图(51.5)、视频(31.2)上最好。
RL 从联合 SFT 的 55.8 出发。只奖答案,平均 56.3,多图从 51.5 掉到 50.8。加上查询质量为 57.3。只加证据可追溯到 59.0,只加视觉锚定到 59.3。两项一起是 61.1,比答案加查询高 3.8。五个基准上完整奖励最好,剩下一个并列最好。
单图相对 OpenSearch-VL 是渐进改进。平均高 1.7,七项同向,幅度有限。值得留下的是训练分布:多图被做成独立数据,三类输入共用一个策略,视频只多了选段和抽帧。联合 SFT 没有把单图做差。只训视频时,SimpleVQA 还高于只训单图。
新基准里组合运算占 91.3%,增益也集中在计数、算术、比较和跨锚点拼接上。视频新基准训完仍是 35.5,先定位时刻再检索这条链还没饱和。
使用成本按专家轨迹看,大约 10 轮工具调用,并且依赖以图搜图和网页搜索。SFT 用 64 张 H800 约 4 天,RL 用 32 张 H800 约 4 天。视觉塔冻住,学到的是何时调用、怎么使用观察。没有搜索接口,这份 8B 权重做不成深研。
论文承认三点。系统依赖 TextSearch、ImageSearch 和会变动的网页,证据是否还在、实验能否精确复现都没有保证。论文建议保存检索快照,并测试工具失败时的表现。自动构建的 VGEG 和模型打出的过程分会带来标注错误与评判偏差。多轮交互的推理和工具成本高,预算需要自适应。
还有几处没有拆开。出题、专家轨迹和 EVGR 的两次评判都用 Seed 2.0 Pro,学生模型是 Qwen3-VL-8B,蒸馏占了多少没有测量。两个新基准和训练题走同一条 VGEG 流水线。基准经过人工复核锚点和出处,分布仍然更贴训练信号。VideoDR 从 30.0 到 57.0,加上七个旧的单图基准,外部参照更干净。主表没有 VideoSearcher、Video-DeepResearch 这类视频深研 agent。视频上的 27.0 个点,对照的是带工具的 Qwen3-VL-8B,以及图像检索模型 OpenSearch-VL(VideoDR 47.0)。联合 SFT 只比纯视频高 0.7,互补成立,幅度很小。55.8 到 61.1 的提升来自 RL。难度按运算类型、跳数和事实条数公式切开,论文写明这不是人类标定的难度。答案判官是 GPT-4o,过程奖励判官是 Seed 2.0 Pro,两套尺度没有对齐实验。