ECCV 论文:负向音频引导实现分步视频生成音效
mittu1204 · x · 2026-08-31
受传统拟音工作流启发,该论文提出了一种分步视频生成音频(V2A)方法,允许用户逐步为视频添加互补声音。为避免依赖昂贵的多参考数据集,该方法将每一步生成建模为负向引导的 V2A 过程,抑制已生成音轨的重复。指导模型通过在单参考音视频数据集的非重叠片段对上微调预训练模型得到,使其利用声学语境同时保持视觉基础。实验表明该方法提升了声音分离度和最终合成质量。
「多模态」频道最新
- MiniMax H3 登陆 Mac:M1 Pro 15 分钟生成 6.6 秒视频 — Nice-Pair-2802 · 2026-08-31
- MiniMax H3 广告生成实测优于 Seedance 2.5 — aziz4ai · 2026-08-31
- Jason 与他的 AI 乐队发布 MV《The Noise of Our Lives》 — Kyrannio · 2026-08-31
- LTX 2.5 Tiled 工作流实测:视频轻松升至 8K — makeitrad1 · 2026-08-31
- 实测 MiniMax h3 模型制作信息图表动画效果惊人 — mrcheriftas · 2026-08-31
- H3 Prompt Writer 新增 Windows 独立版,Qwen 本地 GGUF 直连 — nnorbbi · 2026-08-31