ECCV 论文:负向音频引导实现分步视频生成音效

mittu1204 · x · 2026-08-31

受传统拟音工作流启发,该论文提出了一种分步视频生成音频(V2A)方法,允许用户逐步为视频添加互补声音。为避免依赖昂贵的多参考数据集,该方法将每一步生成建模为负向引导的 V2A 过程,抑制已生成音轨的重复。指导模型通过在单参考音视频数据集的非重叠片段对上微调预训练模型得到,使其利用声学语境同时保持视觉基础。实验表明该方法提升了声音分离度和最终合成质量。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →