用 FFT 压缩 AdamW 优化器状态,VRAM 直接省一半

Spectra-Global · reddit · 2026-10-06

团队为解决在消费级 GPU 上微调 8B/70B 模型时的显存瓶颈,提出不做量化、改从频域下手:用 FFT 变换梯度,剔除低能量频率后再压缩优化器状态,逆变换后方向完整性保留,VRAM 占用约降 50%,batch size 大幅提升;代价是每步多一点计算开销。作者称避免量化是因为观察到 8-bit 量化会损害收敛。现开放内部 Colab 环境与基线权重,邀请他人验证或推翻其数学推导,并征集其他非量化省显存方案。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →