MiniMax 角色 LoRA 训练实测:150 张图 + 约 2300 步才出神似度
Draufgaenger · reddit · 2026-09-04
作者分享了在 Runpod 上训练 MiniMax 角色 LoRA 的实操经验(附 2 分钟视频教程),核心结论:
- 数据集:纯图片数据集远好于混合数据集;聚焦人脸(近乎满帧且清晰);MiniMax 比整 LTX/Wan 需要更多图——金发女性用了 150 张才抓住相似度,作者自己的脸 50 张即可;
- GPU 意外发现:5090 竟然跑赢了 H100(纯图像数据集场景),RTX 6000 PRO 也只比 5090 快约 20%;
- 步数规律:50 张自己脸的数据集在 700 步达到峰值;150 张女性数据集在 2310 步达峰;有趣的是数据集大小不改变峰值步数(50 或 150 张都在 2300 步达峰),但 150 张的 LoRA 客观质量明显更好;
- 数据噪声的影响:150 张中有 4 张棕发图,过峰值后即使提示词写金发也会生成棕发(人脸仍完美);
- 自然语言描述式 caption 效果好,建议把光照、外观也写进去;语音训练 diffusion pipe 不支持,但 MiniMax 可用参考音替代。
「多模态」频道最新
- 用户用 Grok Build 全自动剪出 Tesla Cybercab 电影感视频 — elonmusk · 2026-09-04
- Omni 1.1 视频参考实测:把汽车变成船仍保持高保真 — fofrAI · 2026-09-04
- 用 60 张童年照片微调 SDXL,模拟「记忆回忆」的实验 — uisato · 2026-09-04
- 用 MiniMax H3 复刻 X 热门打斗短片,参考图一致性全程保持 — MixZealousideal9359 · 2026-09-04
- Midjourney 单词提示实验:一个古方言词 Sillion 出图 — tisch_eins · 2026-09-04
- 一条 prompt 生成可逛的 3D 水族馆:Claude 加 Thrixel 新玩法 — RanaHanocka · 2026-09-04