12GB 显存也能训练 LTX-2.3 脸+声音 LoRA,但代价不小
__alpha_____ · reddit · 2026-07-21
一位 Reddit 用户分享:在只有 12GB 显存的 RTX 3060 上训练 LTX-2.3 的 face+voice LoRA 不是轻松活,但确实可以做到。
作者描述了很长一段排错过程,强调数据集必须干净——最好是 2 到 5 秒、有人物清晰对白、没有背景音乐的短片段。为了避免 OOM 和过长训练时间,他建议使用 offloading、卸载 text encoder、4bit 量化、rank 4、cache latents、自动帧数和音频训练等配置。经过几天反复尝试后,他跑出了一个可工作的 1200 steps、rank 4 LoRA,虽然效果还不够好,但说明这条流程是可行的。
「多模态」频道最新
- Fable 为 The Loom 一次做出音乐、乐器和视频 — Sauers_ · 2026-07-21
- 开源 TTS 清单按许可证优先筛选可商用模型 — mahimairaja · 2026-07-21
- AI 戏仿把 Chris Cornell《American Nightmare》做成了梗图海报 — 77sevens · 2026-07-21
- AI 游戏演示开始实时生成声音,配合世界模型画面 — mark_k · 2026-07-21
- Krea2 找到 Raw 4 步加 Turbo 4 步的图像工作流 — PropagandaOfTheDude · 2026-07-21
- Hugging Face 截图显示 Anima 扩散模型多个版本 — RafiHDW · 2026-07-21