Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao
cs.CV, cs.AI
2026-08-05
闭源旗舰在视频问答上常靠记忆蒙混;Video-DR 强制视觉优先,35B 开源模型 64.0% 反超 Claude-4.5-Sonnet(59.0%)。
「深度研究」(deep research)型智能体在图文任务上已经能用工具和联网搜索做事,但搬到连续视频上一直不顺。作者先做了个诊断,发现两个通病。
一是 modality bias(模态偏见):智能体绕开视觉工具,转去用文字搜索凑答案。诊断里 GPT-5 在视频任务上视觉工具调用次数是 0,文字工具也才 0.12 次;Qwen3.5-397B 视觉工具 0.10 次、文字工具 1.27 次。看着像在做多模态,实际没在看视频。
二是 parametric knowledge leakage(参数知识泄漏):模型直接拿记忆里的答案应付,根本不调工具去核实。视频问答尤其严重,因为很多题靠常识就能猜个七七八八。
这两个毛病叠加,结果是模型「答对了」但不是「看视频看对的」,泛化和可信度都成问题。
Video-DeepResearch(Video-DR)的思路是「先看够,再搜网」,靠两条设计把模型摁回视频上。
第一条是解耦的感知-探索管线(decoupled perception-exploration pipeline),配 stage-wise tool unlocking(分阶段解锁工具)。第一阶段只开视觉工具(选关键帧 SelectKeyframe、裁剪搜索 CropSearch),逼模型先把视频每一帧相关内容找出来;视觉锚定做完了,第二阶段才解锁文字工具(联网搜索 Search、访问网页 Visit)。不让模型一上来就跳过画面去搜文字。
第二条是数据管线主动剔除「不靠工具也能答」的题。生成阶段对每道题做 4 次无工具 rollout,凡是裸答就能答对的一律丢弃(parametric-leakage filtering)。最终筛出 3 万条视频问答对、7 千条带工具的正确轨迹。
训练分两阶段:先 SFT(7 千条轨迹加 7 千条文字问答,后者专门补文字工具用得太少的短板),再 GRPO(2 千条中等难度题,答对奖励 1、答错 0),用强化学习突破模仿学习的上限。
作者建了 VideoDR-Bench,200 道 human-AI 协作标注的多跳视频问答,覆盖知识、娱乐、日常、游戏体育、新闻等类目,视频时长从短到长都有。主结果(VideoDR-Bench 平均准确率):
| 模型 | 平均准确率 |
| GPT-5 | 52.5% |
| Gemini 2.5 Pro | 57.5% |
| Claude-4.5-Sonnet | 59.0% |
| Qwen3.5-397B-A13B(开源基座) | 52.8% |
| Video-DeepResearch-30B-A3B | 59.3% |
| Video-DeepResearch-35B-A3B | 64.0% |
35B 版本 64.0%,比 Claude-4.5-Sonnet 高 5.0 个点,把 GPT-5(52.5%)、Gemini 2.5 Pro(57.5%)都甩在后面。在它自己的 Video-DR 基准上更是 68.0%。这个模型只有 35B、激活参数 3B,体量远小于它击败的闭源旗舰。30B 版本也有 59.3%,已经追平 Claude-4.5-Sonnet。
工具调用行为的对比最能说明问题:基座模型视觉工具 0.10 次,Video-DR 拉到 2.33 次,模型真的开始看视频了。消融显示从纯基座 40.5% 一路涨到 59.3%,SFT 数据量和 RL 各贡献一截。
视频是当下多模态最难的落地点,而闭源旗舰普遍在「假装看视频」。这篇给出了一个可复现的开源路径:用工具解锁的顺序强制视觉优先,再用数据清洗堵死「靠记忆答题」的捷径,35B 的开源模型就能在视频深度研究上超过一票闭源旗舰。数据和代码都开源(code 在 Osilly/Vision-DeepResearch),对做视频 agent 的工程团队是现成的起手式。
性能是用大量 GPU 资源换来的,大规模并发模型部署加实时联网搜索,复现成本不低。基准靠人工标注保证质量,但这限制了数据快速扩张,200 题的 benchmark 体量也偏小,类目间分数差异很大(新闻类只有 41.7%、娱乐 65.9%),整体平均可能掩盖偏科。GRPO 阶段对格式违规的负样本做了 20% 概率下采样这种工程技巧,效果是否稳定还需要更多设置验证。