MiniMax H3 唇舞视频工作流:1.4MP 分辨率需 3-4 小时
TheDerminator1337 · reddit · 2026-08-26
作者分享了使用 MiniMax H3 制作对口型音乐视频的参考工作流,结合 FL2VA 和 REF2VA Lora,在 1.4MP 分辨率、20 步数下,使用稀疏注意力和 4B Qwen 文本编码器,单次 5090 渲染耗时 3-4 小时。若使用 1MP + 8 步数的 Turbo Lora,仅需 20-30 分钟。视频由 14 个 15 秒片段拼接而成以防止画质退化,但会导致服装漂移,建议使用服装参考图修复。作者建议未来将片段缩短至 7 秒以提高分辨率和生成速度。
「多模态」频道最新
- 手机 LiDAR 扫描转可编辑 3D 双生,重塑建模工作流 — maier_ak · 2026-08-26
- LiDAR 扫描变可编辑 3D 双胞胎:房产、保险与游戏场景 — maier_ak · 2026-08-26
- Pavo上线AgnesVideo2.5模型,免费策略降低AI短剧成本 — 新智元 · 2026-08-26
- 开源 Discord 插件:一键复制图片并生成 Krea2 提示词 — Ok_Clothes9170 · 2026-08-26
- LAION-BVD:千万小时多模态预训练视频数据集 — Andreas Hochlehnert · 2026-08-26
- Reddit 用户用 AI 生成动画短片剧集《Realmz of the Redeemers》 — Kindly_Poet_7878 · 2026-08-26