AMD 7900 XTX 在 24GB 显存上跑通 FLUX.2 LoRA 训练
elderon_echar · reddit · 2026-07-24
这是一篇非常硬核的实战帖:作者在 AMD RX 7900 XTX 24GB 显卡上,用 原生 ROCm + Windows 成功训练了 32B 的 FLUX.2 LoRA,而且全程没有靠 CUDA shim 或 ZLUDA。
- 关键条件是把 32B FLUX.2 dev transformer 真正常驻在 GPU 上训练;作者在只有 32GB 系统内存 的机器上,通过大 pagefile、CPU 侧量化和一系列内存/加载修复把流程跑通。
- 文中按失败顺序总结了多个坑:safetensors 的 mmap 读取会直接崩、trainer 先把整块 bf16 搬上 GPU 导致 OOM、加载文本编码器时引用没释放、layeroffloading 会让 HIP 驱动死锁、训练中采样和黑图预览不可用、expandablesegments 能避免碎片化 OOM 但也可能让激活溢出到主存。
- 作者还特别提醒:在 ROCm/Windows 下,不要信跨进程的 VRAM 读数;更可靠的是进程内日志、Windows 的 GPU 计数器,以及系统内存下降情况。
- 最后,他用 ComfyUI + ComfyUI-GGUF 来评估 checkpoint,并指出在这套流程里,分辨率才是最主要的速度旋钮。
「Infra」频道最新
- Geekbench 7 重置分数体系,Snapdragon X2 Elite 多核提升接近 16% — ryanshrout · 2026-07-24
- 英特尔确认 2028 年大规模量产 14A 工艺 — BenBajarin · 2026-07-24
- Pydantic AI 展示 agent 一票分出 40 组测试,笔记本风扇先炸了 — AAAzzam · 2026-07-24
- Fluidstack 完成 8.3 亿美元 A 轮,估值达 75 亿美元 — MxMnr · 2026-07-24
- Google 今年 capex 指引已超过其 2021 年前全部累计开支 — ivan_bezdomny · 2026-07-24
- 英特尔称先进封装已起 backlog,业务可见度达数十亿美元 — BenBajarin · 2026-07-24