CoEvoWhen 策略-工具协同进化,搞定超长视频时间定位还省视觉 token
zju · hf · 2026-10-01
超长视频时间定位需在有限视觉预算下兼顾长程证据搜索与细粒度事件理解,现有智能体方法仍依赖预定义策略与固定工具。浙大提出策略-工具协同进化框架:从 VLM 的智能体推理轨迹中联合进化高层策略与可执行媒体工具,形成无需更新模型参数的可复用技能。外部技能更新器蒸馏可迁移的长视频任务经验,优化基于图像的长程观察与基于视频的细粒度观察的编排,并用编码能力升级或新建工具。
进化后的 VLM 自主编排工具完成推理,不依赖更强的独立规划模型。跨五个基准、三个 VLM 的实验显示,协同进化持续提升超长视频定位精度并降低推理视觉 token 成本,进化技能还能零额外进化地在通用长视频 QA 上取得显著增益。
「研究」频道最新
- Nature Genetics 论文发布 ArchMap:免代码单细胞数据比对参考图谱平台 — burny_tech · 2026-10-01
- arXiv 新论文:用世界文学方法构建有文化素养的 AI — begusgasper · 2026-10-01
- NVIDIA 发布 Instant NuRec:1.5 秒前馈重建驾驶场景 3DGS 世界 — rsasaki0109 · 2026-10-01
- KV-streams 方法让 SWE Agent 训练提速 2 倍且不掉点 — burny_tech · 2026-10-01
- 用「自我」替代「人格」?模型心理学术语之争引热议 — repligate · 2026-10-01
- 硅微环调制器突破单通道 200Gb/s,为 AI 光互连降功耗 — jwt0625 · 2026-10-01