TimeLens2 用集合式监督提升视频时序定位

MCG-NJU · hf · 2026-07-21

**TimeLens2** 提出了一种面向多模态 LLM 的通用视频时序定位新方法。 - 目标是更难的设定:模型不仅要理解视频内容,还要在不同视频长度、领域、提问形式和视角下,找出**可变数量**的证据时间片段。 - 论文认为,现有训练方式与这种“集合型”任务不匹配,尤其是长视频标注和强化学习奖励都存在偏差。 - 为此,TimeLens2 从端到端把证据当作“区间集合”来处理,并提出: - **TimeLens2-93K**:通过 caption 提议、独立定位、跨智能体一致性、语义验证和边界细化构造的多片段监督数据集。 - **时间 Wasserstein 奖励**:基于区间支持集之间的精确一维 Wasserstein 距离,提供无需匹配的稠密反馈。 - **temporal IoU**:补充更精确的重叠反馈。 - 在 7 个基准上,2B 版本在同规模对比中全部领先;4B 和 8B 版本达到 SOTA,并超过参数最高达 397B 的开源模型。 - 相比 Qwen3-VL backbone,2B/4B/8B 分别提升 **14.2 / 13.0 / 18.1 mIoU**。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →