OneSearch-VL:统一多模态深度研究 Agent,8B 模型超 Qwen3-VL 20 个百分点

Hongyu Li · hf · 2026-10-09

OneSearch-VL 是一个面向图像与视频的统一多模态深度研究 Agent,核心是视觉接地证据图(VGEG),将局部视觉锚点、实体关系、证据支撑的事实与答案生成操作之间的依赖编码为任务级参考,贯穿数据构建、过程监督与操作级评测。

其数据引擎构建并验证多图与视频问题,产出 OneSearch-VL-SFT-110K 与 RL 用 OneSearch-VL-RL-10K 数据集;RL 阶段用从 VGEG 派生的 Evidence-aware Visual-Grounded Rubric(EVGR)奖励监督证据可追溯性。评测上构建了 OneSearch-MI-Bench 与 Video-Bench:OneSearch-VL-8B 在两个新基准上分别比带工具的 Qwen3-VL-8B 高 20.2 和 17.6 个百分点,并在 7 个图像基准与 VideoDR 上取得显著提升。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →