Minimax H3 实测:一张图加音频生成唱跳视频,6 步 768p 半小时

aziib · reddit · 2026-09-08

作者分享用 Minimax H3 从参考图和音频生成唱歌跳舞视频的完整工作流:使用 HuggingFace 上的 better-human-motion LoRA、Civitai 上的 fast-minimax-h3 工作流、fused-turbo-int8 量化 checkpoint;角色形象来自 VRoid 3D 模型,歌声用 RVC 从 ElevenLabs 声音训练而成。生成参数为 6 步、768p,15 秒视频约需 30 分钟。

所属事件:MiniMax H3 实测:一张图加音频生成唱跳视频(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →