Video-DeepResearch 准确率超 GPT-5 与 Claude
Zhen Fang · hf · 2026-08-05
本文提出 Video-DeepResearch (Video-DR),将多模态智能体从静态图像扩展至连续视频流,要求密集的时空定位与开放网络探索。
- 解决痛点:针对当前模型“偏好文本搜索而绕过视觉工具”以及“依赖内部记忆而非真实工具调用”的问题。
- 核心方法:采用解耦的感知-探索管线,分阶段解锁工具,强制进行跨帧视觉定位。训练结合了 SFT 与 GRPO。
- 新基准:构建了 Video-DR-Bench,包含 200 个复杂多跳视频问答实例。
- 实测效果:Video-DeepResearch-35B-A3B 取得 64.0% 的平均准确率,刷新 SOTA,显著超越 Claude-4.5-Sonnet (59.0%)、GPT-5 (52.5%) 和 Gemini 2.5 Pro (57.5%)。
「编程与Agent」频道最新
- 等模型迭代半年,独立开发者用 Claude 一天写完 App — airkatakana · 2026-08-05
- 探讨 cmux 多列侧边栏设计:机器、工作区与 Agent 编排 — philipvollet · 2026-08-05
- 国产模型包揽预测榜单前三,AI 预测智能体实测 — teortaxesTex · 2026-08-05
- eidoverse-worlds:人与AI共享持久3D世界的开源平台 — repligate · 2026-08-05
- 首个 AI Agent 审计规范 AARM 发布,9 大属性对抗记忆投毒 — Funky_Chicken_22 · 2026-08-05
- 什么是“软件工厂”?AI 智能体重塑现代软件开发周期 — Pavan_Belagatti · 2026-08-05