ECCV 2026 论文 SemVID:长视频理解如何靠证据链剪枝
量子位 · wechat · 2026-07-30
长视频时序定位(VTG)要求模型准确判断事件的起止时间,而不仅仅是识别画面内容。被 ECCV 2026 录用的 SemVID 工作指出,针对 VTG 的视觉 token 剪枝不能像传统 VideoQA 那样只保留“显著画面”,而必须保住一条支撑时间定位的“证据链”。
SemVID 提出了一个无需训练的 token 剪枝框架。它结合 query 相关度与帧间变化来分配 token 预算,并在帧内显式分离出 Object(对象证据)、Motion(动作转折)和 Context(场景锚点)三类语义 token。实验表明,在极低保留率下,该方法仍能稳定保持较高的边界定位精度,避免了证据碎片化。
「多模态」频道最新
- Ideogram 4.0 模型 LoRA 训练参数探讨:24图1700步效果初探 — Zealousideal-Car4724 · 2026-07-30
- Audio8-TTS 预览版登顶 Hugging Face 趋势榜 — Audio8 · 2026-07-30
- AI导演用 Kimi K3 配合 Seedance 2.0 生成完整游戏流程 — Xianbao_QIAN · 2026-07-30
- VAST亮相SIGGRAPH:秒级生成可动3D资产,连中五篇论文 — 机器之心 · 2026-07-30
- Flux 3 文生视频实测:单提示词搞定法语与网页截图融合 — OdinLovis · 2026-07-30
- 中国 AI 模型展示「史上最伟大」任意球 — ZabihullahAtal · 2026-07-30