ECCV 2026 论文 SemVID:长视频理解如何靠证据链剪枝

量子位 · wechat · 2026-07-30

长视频时序定位(VTG)要求模型准确判断事件的起止时间,而不仅仅是识别画面内容。被 ECCV 2026 录用的 SemVID 工作指出,针对 VTG 的视觉 token 剪枝不能像传统 VideoQA 那样只保留“显著画面”,而必须保住一条支撑时间定位的“证据链”。

SemVID 提出了一个无需训练的 token 剪枝框架。它结合 query 相关度与帧间变化来分配 token 预算,并在帧内显式分离出 Object(对象证据)、Motion(动作转折)和 Context(场景锚点)三类语义 token。实验表明,在极低保留率下,该方法仍能稳定保持较高的边界定位精度,避免了证据碎片化。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →