谷歌等推出 SepGen:一个模型同时生成视频与分轨音源

YonatanBitton · x · 2026-10-11

特拉维夫大学与 Google 研究者发布 SepGen,把预训练音视频生成模型扩展为单次前向即输出每条声源的独立波形(连同视频与混音),支持生成与分离双模式:既可按文本描述为每个声源生成独立音轨,也可把现有视频的混音拆成多轨。

由于各声源可单独寻址,研究者将它们放入升维后的 4D 场景,从新视角渲染出空间音频;论文还提供了可交互 demo,可在场景中走动、转动视角并听到声音随方位变化。附加训练在不改变原混音的前提下提升生成质量,语音任务上表现最强。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →