首篇系统综述:视频-音频联合生成与编辑统一形式化,9 类 28 种编辑

Abhinav Sharma · hf · 2026-10-02

一篇新综述系统梳理了视频与音频联合建模的生成方法,指出尽管两种模态总被一起感知,多数生成模型却将其割裂处理。

核心内容:

适合关注多模态生成方向的研究者作为路线图使用。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →