FourTune:真正的 4-bit 扩散后训练
amaarora · x · 2026-07-19
FourTune 讨论的是:扩散模型后训练并不会因为“只把权重量化成 4-bit”就真正变成 4-bit,因为激活值和反向梯度仍然占主要计算与显存开销。
它提出三点设计来稳定并加速训练:
- 一个冻结的 stabilizer 分支,专门承载量化敏感的异常值;
- block quantization,让 4-bit 反向传播里的转置乘法可行;
- fused kernels,减少小分支带来的内存流量。
实验上,作者报告在 FLUX 定制任务里,相比 BF16 LoRA 可做到 2.25x 更低显存、2.27x 更快步进。帖子配图还展示了在不同设置下的训练延迟、显存占用和定制效果对比。
「多模态」频道最新
- 用 MiniMax H3 MAX 对一只蚊子放大招,蚊子毫发无伤 — Hailuo_AI · 2026-09-11
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11
- Imperium 游戏预告片曝光,AI 视频生成再秀肌肉 — keaslenyt · 2026-09-11
- FLUX.2 Klein 换表情易丢脸,实测不如免费版 Gemini 保真 — wacomlover · 2026-09-11