MiniMax 图生视频新玩法:结合 fl2va 与 ref2va 实现声音克隆
spiderofmars · reddit · 2026-08-14
作者分享了在 MiniMax 图生视频工作流中,意外发现可以使用 fl2va 和 ref2va 模型实现声音克隆的方法。
- 工作流设置:在 ref2va 节点中输入首帧参考图和音频样本,即可克隆声音并生成新对白。
- 模型对比:fl2va 模型的音质更好且动作自然;ref2va 模型音质较差,但会自发增加额外的镜头运动(如模拟车内视角的晃动)。
- 效果评估:作者认为声音相似度可达 95%,但发现克隆出的声音在情感表达上不如模型随机生成的声音丰富。
「多模态」频道最新
- MiniMax Music 3 开源上线,社区预言开源音乐革命即将爆发 — TheChuckTone · 2026-08-14
- MiniMax H3 视频生成实测:保龄球场景效果惊艳 — howdyquade · 2026-08-14
- 文本生成音乐模型挑战:硬style鼓点成难题 — cephaloform · 2026-08-14
- MiniMax H3 视频生成实测:用户表示玩得很开心 — esudious · 2026-08-14
- ComfyUI 更新:MiniMax H3 支持任意帧锚定图像和音频引导 — fruesome · 2026-08-14
- ComfyUI 合并 PR:MiniMax H3 支持任意帧图像和音频引导 — fruesome · 2026-08-14