NUS提出并行自回归解码框架,大幅提升密集视频描述生成效率

NationalUniversityofSingapore · hf · 2026-07-08

新加坡国立大学提出面向全模态密集视频描述(Omni-Modal Dense Video Captioning)的并行自回归解码框架。该研究发现,在时间上相距较远的视频事件之间存在较弱的局部依赖性,可利用这一特性将原本串行的自回归生成过程并行化,在维持时间定位精度的同时大幅提升生成效率。该方法为大规模视频理解中长序列生成的效率瓶颈提供了可行的解决路径。

所属事件:NUS提出并行自回归解码框架,提升视频字幕效率(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →