SlideDP:4 张 RTX 4090 微调 Qwen2.5-72B,吞吐超 FSDP2 11.2%
Ruijia Yang · hf · 2026-10-01
- 问题:host-resident 分层流式微调可在 GPU 显存外做全参数微调,但数据并行各 rank 争抢共享主机资源:复制传输放大流量,强扩展又暴露 CPU 瓶颈。
- 方案:SlideDP 是共享主机多 GPU 系统上的同步数据并行运行时:维护单一权威主机状态、把通信路由与状态布局解耦、跨 rank 与 chunk 流水线化参数下发、梯度聚合和 CPU 更新;并给出解析的 step-time 模型定位资源瓶颈。
- 结果:等 batch 扫描下,对 SlideFormer/MegaTrain/ZeRO-Offload 的几何平均吞吐比达 1.46–2.64 倍;4 张 H100 上逼近 GPU 常驻 FSDP2 的 Qwen3-14B 吞吐,大 batch 时每步处理超 100 万 token、超过 FSDP2 实测峰值 11.2%;支持 256K 长序列,并用 4 张 RTX 4090 微调了 Qwen2.5-72B。代码已开源。
「Infra」频道最新
- 华为 Mate 90 发布:麒麟 9050 Pro 首用 LogicFolding 架构 — ingliguori · 2026-10-01
- A20 标准版疑不用 WMCM 封装,爆料的回应只有三个字:产能不够 — zephyr_z9 · 2026-10-01
- TRL 月训练量破 100 万次,团队瞄准每周百万 — QGallouedec · 2026-10-01
- oMLX 0.7.0 发布:长上下文解码提速 50%,重写内存守护 — pcuenq · 2026-10-01
- 中国单月用电量创历史新高,但工业电力需求增速放缓 — teortaxesTex · 2026-10-01
- NVIDIA Dynamo Snapshot 将 LLM 扩容冷启动时间降低约 10 倍 — Nasereliver · 2026-10-01