实测发现:AI视频配音无法同时用两段参考音频

Portable_Solar_ZA · reddit · 2026-08-29

一位参加 Comfy Sync 比赛的开发者经过大量测试发现,目前的音频生成模型无法同时接受两段参考音频并让它们在同一时刻共存:同时给参考人声和参考音乐,音乐会在人声出现时消失或变得几乎不可闻、含糊不清。

可行的做法是「1 参考音频 + 1 模型生成」:参考人声 + 模型生成音乐,或模型生成人声 + 参考音乐,两者叠加可正常工作。他原计划用自定义旁白加参考音乐做预告片,最终只能放弃这一组合。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →