12GB 显存也能训练 LTX-2.3 脸+声音 LoRA,但代价不小
__alpha_____ · reddit · 2026-07-21
一位 Reddit 用户分享:在只有 12GB 显存的 RTX 3060 上训练 LTX-2.3 的 face+voice LoRA 不是轻松活,但确实可以做到。
作者描述了很长一段排错过程,强调数据集必须干净——最好是 2 到 5 秒、有人物清晰对白、没有背景音乐的短片段。为了避免 OOM 和过长训练时间,他建议使用 offloading、卸载 text encoder、4bit 量化、rank 4、cache latents、自动帧数和音频训练等配置。经过几天反复尝试后,他跑出了一个可工作的 1200 steps、rank 4 LoRA,虽然效果还不够好,但说明这条流程是可行的。
「多模态」频道最新
- Midjourney V8.2 加入个性化并展示新图像效果 — Mr_AllenT · 2026-07-27
- Midjourney 图像多样性引发 Krea 2 对比与复现提问 — diffusion_throwaway · 2026-07-27
- AI 短片把 1985 年反乌托邦拍成电影感作品 — ProfessorKey98 · 2026-07-27
- Google Omni 做出的 BOTPD 新集变成追车戏仿 — ScriptLurker · 2026-07-27
- 一个新 LoRA 复刻了 GTA: San Andreas 的 RenderWare 画风 — Humble-Pick7172 · 2026-07-27
- AMD R9700 开启动态 VRAM 后,LTX 2.3 生成速度大幅提升 — xdcfret1 · 2026-07-27