用 MiniMax H3 与 ACE-Step 做 AI 音乐视频:升级模型反而不一定更好
WolframRvnwlf · x · 2026-09-30
一位创作者复盘了全 AI 音乐视频的制作经验:
- 模型升级≠效果更好:从 MiniMax H3 Fused 4-Step 换到 Full 版后,部分镜头细节增加,但丢掉了原本喜欢的运镜和表演,还出现多余的背景人物、不该唱歌的音乐人、损坏的乐器等问题。最终他们拒绝了整体替换,在新旧两版中挑选最佳镜头混合剪辑。
- 音频细节最难搞:Whisper large-v3 和 Gemini 3.5 Flash 对歌词、"WE BITE BACK" 重复次数的转写不一致,只能作为线索,精确的歌词对时还得靠人工听音、看波形和乐感判断。
- 分离后重对时的修音听起来不对,更好的办法是复用前面副歌中完整的乐句并对齐。
制作工具栈:ACE-Step 1.5 XL SFT LM 4B(StepFun 等)负责歌曲与人声;MiniMax H3 Ref2VA 生成参考图引导的表演;FLUX.2 [klein] 9B 生成音乐人单体重参考;字节 Seedream 5.0 Pro 与 SeedVR2 负责舞台参考和全乐队画面。
「多模态」频道最新
- Claude Opus 5.5 还原《戴珍珠耳环的少女》创作瞬间,网友直呼动人 — justin_hart · 2026-09-30
- Reddit 用户用 AI 制作出科幻短片《Erebus-9: The Hiveborn Archives》 — himeonisama · 2026-09-30
- 让 Claude Opus 自己标注时间戳配音:实测人机协作解说视频工作流 — RileyRalmuto · 2026-09-30
- 阿里达摩院开源 WorldAttention:交互式视频世界模型高效注意力架构 — Alibaba-DAMO-Academy · 2026-09-30
- 新加坡国立大学 MaLiang-Harness:用可执行程序控制图像视频生成,并定义 P2V 差距 — NationalUniversityofSingapore · 2026-09-30
- KAIST 推出 Thinking Reward Model:先定评分细则再审图,开源奖励模型登顶 — Xuehai Bai · 2026-09-30