MiniMax H3 教程:图文音视频多模态 LoRA 训练

shootthesound · reddit · 2026-08-19

作者发布了一份 MiniMax H3 数字人 LoRA 训练教程,涵盖声音与形象克隆。演示中使用的 LoRA 在 35 张图片、26 个音频文件和一个视频片段的混合数据集上训练。教程介绍了名为 Gizmo 的新数据准备工具,并建议训练策略:前期混合数据,40 轮后切换至纯音频模式以优化声音而不破坏画质。作者指出静态图与音频组合最快,视频则用于教导模型未知动作。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →