CoEvoWhen 策略-工具协同进化,搞定超长视频时间定位还省视觉 token

zju · hf · 2026-10-01

超长视频时间定位需在有限视觉预算下兼顾长程证据搜索与细粒度事件理解,现有智能体方法仍依赖预定义策略与固定工具。浙大提出策略-工具协同进化框架:从 VLM 的智能体推理轨迹中联合进化高层策略与可执行媒体工具,形成无需更新模型参数的可复用技能。外部技能更新器蒸馏可迁移的长视频任务经验,优化基于图像的长程观察与基于视频的细粒度观察的编排,并用编码能力升级或新建工具。

进化后的 VLM 自主编排工具完成推理,不依赖更强的独立规划模型。跨五个基准、三个 VLM 的实验显示,协同进化持续提升超长视频定位精度并降低推理视觉 token 成本,进化技能还能零额外进化地在通用长视频 QA 上取得显著增益。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →