MiniMax H3 教程:图文音视频多模态 LoRA 训练
shootthesound · reddit · 2026-08-19
作者发布了一份 MiniMax H3 数字人 LoRA 训练教程,涵盖声音与形象克隆。演示中使用的 LoRA 在 35 张图片、26 个音频文件和一个视频片段的混合数据集上训练。教程介绍了名为 Gizmo 的新数据准备工具,并建议训练策略:前期混合数据,40 轮后切换至纯音频模式以优化声音而不破坏画质。作者指出静态图与音频组合最快,视频则用于教导模型未知动作。
「多模态」频道最新
- Apple 推出 Internalized Visual Thinking 加速视频推理 — apple · 2026-08-19
- ComfyUI 缓存监控工具更新:支持手动固定与释放 VRAM — Incognit0ErgoSum · 2026-08-19
- 百万张 19 世纪公版插画数据集发布,含实例掩码 — wjb_mattingly · 2026-08-19
- 新基准 SciFigPlag-Bench 挑战 LLM 检测图表剽窃能力 — anshulkundaje · 2026-08-19
- 为何移除视觉编码器是更好的基础设施选择 — kastnerkyle · 2026-08-19
- LightOnOCR-2-1B 开源走红:轻量端到端 OCR 模型下载超 300 万 — adnan_hashmi · 2026-08-19