FourTune:真正的 4-bit 扩散后训练
amaarora · x · 2026-07-19
FourTune 讨论的是:**扩散模型后训练并不会因为“只把权重量化成 4-bit”就真正变成 4-bit**,因为激活值和反向梯度仍然占主要计算与显存开销。 它提出三点设计来稳定并加速训练: - 一个冻结的 stabilizer 分支,专门承载量化敏感的异常值; - block quantization,让 4-bit 反向传播里的转置乘法可行; - fused kernels,减少小分支带来的内存流量。 实验上,作者报告在 FLUX 定制任务里,相比 BF16 LoRA 可做到 **2.25x 更低显存**、**2.27x 更快步进**。帖子配图还展示了在不同设置下的训练延迟、显存占用和定制效果对比。
「多模态」频道最新
- 纸雕风图像提示词模板 — azed_ai · 2026-07-20
- Midjourney 和 Seedance 动效作品 — Swimming-Tooth2422 · 2026-07-20
- 用 AI 伪造体育直播画面 — techhalla · 2026-07-20
- 商汤U1 Pro主打交付级生图 — KevinNaughtonJr · 2026-07-20
- Seedance 领跑 AI 电影制作 — taherdhanera · 2026-07-20
- ComfyUI里怎么给Anima Turbo做放大 — SILVER5893 · 2026-07-20