FourTune:真正的 4-bit 扩散后训练

amaarora · x · 2026-07-19

FourTune 讨论的是:**扩散模型后训练并不会因为“只把权重量化成 4-bit”就真正变成 4-bit**,因为激活值和反向梯度仍然占主要计算与显存开销。 它提出三点设计来稳定并加速训练: - 一个冻结的 stabilizer 分支,专门承载量化敏感的异常值; - block quantization,让 4-bit 反向传播里的转置乘法可行; - fused kernels,减少小分支带来的内存流量。 实验上,作者报告在 FLUX 定制任务里,相比 BF16 LoRA 可做到 **2.25x 更低显存**、**2.27x 更快步进**。帖子配图还展示了在不同设置下的训练延迟、显存占用和定制效果对比。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →