8GB 显卡跑 130M 模型 100 万步不崩:自适应显存调度器实验

uBazzyZ- · reddit · 2026-09-10

一位开发者在 RTX 5060 Ti(8GB)上训练小模型时频繁遭遇 CUDA OOM,于是写了 MEM Orchestrator——一个 PyTorch 运行时控制层,核心思路是训练中监控显存压力,在 OOM 前临时下调 micro-batch 大小和梯度累积步数,显存缓解后再回升。

实现要点:

实验结果:130M 模型 endurance 测试跑满 100 万步零崩溃;对 255M 模型注入 +1.2GB 显存尖峰(FineWeb-Edu 5 万步),控制器成功自适应并保住训练。作者明确表示不宣称解决 OOM,主要是征集 CUDA allocator、DeepSpeed、分布式训练方向专家的意见。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →