MEM v3 开源:动态调 batch 防 CUDA OOM,扛住 +10GB 显存冲击
uBazzyZ- · reddit · 2026-09-27
作者开源了 MEM v3,一个针对 PyTorch 长时间训练/微调中 CUDA 显存溢出崩溃的「内存调速器」,实时监控 VRAM 和吞吐,动态调整 batch size 和梯度累积,无需重启进程。
核心特性:
- 动态换道(dynamic lane switching):根据实际 GPU 显存压力毫秒级伸缩 batch size,不必为保平安把 batch 常年调小
- 抗冲击:实测能扛住突然 +10GB VRAM 分配冲击而不崩溃
- 防损 checkpoint:跨轮换槽位用原子文件替换 + SHA-256 校验,断电也不会写坏权重
- 自带本地 web 仪表盘实时追踪 loss、吞吐和换道事件
提供免配置的 Colab 演示笔记本,仓库在 GitHub:nobazzy/mem-llm-orchestrator。
「Infra」频道最新
- 哈佛免费开放 CS249r:从芯片到推理的全栈 ML 系统课 — techNmak · 2026-09-27
- SpaceX 全美布局图解:从火箭到 Grok 训练算力的垂直整合帝国 — XFreeze · 2026-09-27
- Swift-1.5-Qwen3.8-27B 量化版冲上 Hugging Face 热榜 — ukisai · 2026-09-27
- 开发者用 DGX Station 让本地模型做 CAD,邀 SF 同好一起 hacking — hudzah · 2026-09-27
- Yacine 罕见表态:对 TensorTorrent 相当看好 — yacineMTB · 2026-09-27
- DeepSeek V5 爆料:2 万亿参数,或首次全部用华为昇腾训练 — teortaxesTex · 2026-09-27