NUS提出并行自回归解码框架,大幅提升密集视频描述生成效率
NationalUniversityofSingapore · hf · 2026-07-08
新加坡国立大学提出面向全模态密集视频描述(Omni-Modal Dense Video Captioning)的并行自回归解码框架。该研究发现,在时间上相距较远的视频事件之间存在较弱的局部依赖性,可利用这一特性将原本串行的自回归生成过程并行化,在维持时间定位精度的同时大幅提升生成效率。该方法为大规模视频理解中长序列生成的效率瓶颈提供了可行的解决路径。
所属事件:NUS提出并行自回归解码框架,提升视频字幕效率(2 条相关)→
「多模态」频道最新
- Kling V3 仅凭一个提示词做出连续电影感长镜头 — umesh_ai · 2026-07-21
- Kimi K3 Max 在 sketch-to-3D 上胜过 Qwen 3.8 Max preview — OfirPress · 2026-07-21
- AI 视频创作中的《吉尔伽美什》史诗场景 — AiIsArtHumanIsFart · 2026-07-21
- 独立创作者用 Veo 3 和 Suno 做出《MALINI》,门口声音才是真实的 — prakm023 · 2026-07-21
- 图灵深视发布图灵鉴 X,做多模态商品评估 — 机器之心 · 2026-07-21
- Hugging Face 热门模型 Diamond-1.0 主打音频到音频增强 — nineninesix · 2026-07-21