Hugging Face 新增激活检查点卸载,大模型显存占用骤降
StasBekman · x · 2026-09-01
Hugging Face Transformers 合并了一项新功能,为梯度检查点(gradient checkpointing)增加了卸载选项(offload)。
核心功能:
- 将原本驻留在 GPU 显存中的检查点激活值转移到 CPU 的锁定内存(pinned host memory)中。
- 这对于处理长上下文(如 128k tokens)或使用更少 GPU 运行大模型非常有用,无需依赖复杂的并行技术即可释放大量显存。
- 通过 TrainingArguments 中的 gradientcheckpointingkwargs={"offload": True} 即可启用。
技术原理:
- 这是对 PyTorch saveoncpu(pinmemory=True) 的封装,遵循模型现有的路径,无需针对特定模型进行额外支持。
- 作者认为如果实现全重叠(full overlap),这几乎可以是零性能成本的功能,应成为核心特性,并质疑为何 PyTorch 尚未原生实现。
「Infra」频道最新
- Shopify 揭示持续学习循环:压缩失败至权重,成本降 96% — yenkel · 2026-09-01
- Shopify 工程师详解 GraphQL Agent 的持续学习实践 — Drewch · 2026-09-01
- 推理厂商 Wafer 拒收购募资 4000 万美元,估值超 2 亿 — steph_palazzolo · 2026-09-01
- x402 标准:为智能体经济构建原生支付层 — kleffew94 · 2026-09-01
- 定制 HBM 可将 LLM 推理速度提升 5 倍 — BenBajarin · 2026-09-01
- fal 实现超实时视频生成与 3 亿素材搜索 — noahsolomon · 2026-09-01