FourTune:真正的 4-bit 扩散后训练

amaarora · x · 2026-07-19

FourTune 讨论的是:扩散模型后训练并不会因为“只把权重量化成 4-bit”就真正变成 4-bit,因为激活值和反向梯度仍然占主要计算与显存开销。

它提出三点设计来稳定并加速训练:

实验上,作者报告在 FLUX 定制任务里,相比 BF16 LoRA 可做到 2.25x 更低显存、2.27x 更快步进。帖子配图还展示了在不同设置下的训练延迟、显存占用和定制效果对比。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →