12GB 显存也能训练 LTX-2.3 脸+声音 LoRA,但代价不小

__alpha_____ · reddit · 2026-07-21

一位 Reddit 用户分享:在只有 12GB 显存的 RTX 3060 上训练 LTX-2.3 的 face+voice LoRA 不是轻松活,但确实可以做到。

作者描述了很长一段排错过程,强调数据集必须干净——最好是 2 到 5 秒、有人物清晰对白、没有背景音乐的短片段。为了避免 OOM 和过长训练时间,他建议使用 offloading、卸载 text encoder、4bit 量化、rank 4、cache latents、自动帧数和音频训练等配置。经过几天反复尝试后,他跑出了一个可工作的 1200 steps、rank 4 LoRA,虽然效果还不够好,但说明这条流程是可行的。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →