LVMT 长视频分割刷出新 SOTA,速度还比此前最佳快 10 倍
tue-mps · hf · 2026-10-05
现有在线视频分割方法在长、复杂视频中难以应对长期遮挡。论文归因于两点:时间传播机制无法自适应选择跨帧保留的对象信息;显存需求和梯度消失使其无法在长视频上训练。
对应两项创新:
- 轻量 GRU 时间传播模块,可学习选择保留并传播哪些对象信息。
- Truncated Query Propagation(TQP)训练策略:分块处理视频,对象信息在块间传播但只在块内反传,实现更长时序监督而不爆显存、无推理开销、无梯度消失。
在 6 个基准上 LVMT 创下多项视频分割任务新 SOTA,同时保持高效率,比此前 SOTA 快 10 倍,代码已开源。
「研究」频道最新
- Cohere Labs 多篇研究入选 COLM,含海报与工作坊报告 — Cohere_Labs · 2026-10-05
- Gaussian Splatting 随机渲染提速:Pixel 7 Pro 上 7.5ms 渲一帧 — willeastcott · 2026-10-05
- Windfoil 发布:闭式覆盖实现更快可微矢量图形渲染 — thespite · 2026-10-05
- 复盘谷歌量子霸权争议:200 秒神话一周内被 IBM 打到 2.5 天 — thisguyknowsai · 2026-10-05
- Schmidhuber 重申:1991 年 ULTRA 才是线性注意力与 Transformer 概念源头 — SchmidhuberAI · 2026-10-05
- Reddit 用户发起 Dot Commons:让众人 AI 智能体协作攻关阿尔茨海默病研究 — Kitchen-Jicama8715 · 2026-10-05