用 FFT 压缩 AdamW 优化器状态,VRAM 直接省一半
Spectra-Global · reddit · 2026-10-06
团队为解决在消费级 GPU 上微调 8B/70B 模型时的显存瓶颈,提出不做量化、改从频域下手:用 FFT 变换梯度,剔除低能量频率后再压缩优化器状态,逆变换后方向完整性保留,VRAM 占用约降 50%,batch size 大幅提升;代价是每步多一点计算开销。作者称避免量化是因为观察到 8-bit 量化会损害收敛。现开放内部 Colab 环境与基线权重,邀请他人验证或推翻其数学推导,并征集其他非量化省显存方案。
「Infra」频道最新
- 去年美国仅装机 3-4 万台机器人,作者倡建自复制工厂 — ihorbeaver · 2026-10-06
- Reflection 披露 Beam 训练效率:MFU 约 19%,四周内 goodput 冲到 92% — alexpolozov · 2026-10-06
- SGLang 合入 layer_boundary:跨模型复用 TP/DP/CP 通信语义 — BanghuaZ · 2026-10-06
- 警惕 SpotGPUs.com:伪造「交易错误」吞掉加密货币充值 — Equivalent_West7788 · 2026-10-06
- 拆解 ChatGPT 式架构:从请求到流式响应的九个环节 — jawadhamza · 2026-10-06
- SGLang Summit 2026 议程公布:Intel、OpenAI、NVIDIA 高管齐聚 — BanghuaZ · 2026-10-06