AWS 实测 NVRx 容错训练:同步 checkpoint 曾耗掉 40% 墙钟时间
AWS ML Blog · rss · 2026-09-17
AWS ML Blog 发布在 Amazon EKS 上用 NVIDIA Resiliency Extension (NVRx) 做大规模容错分布式训练的完整方案。
问题:大训练跑数天跨多节点,故障不可避免;单个 GPU 故障会让 NCCL 超时级联拖垮健康 worker;同步 checkpoint 阻塞所有 rank 的 I/O,在该集群规模下曾消耗高达 40% 的总墙钟时间。
NVRx 三层独立容错能力(pip 安装即可,不改模型和训练代码):
- 异步 checkpoint:TorchAsyncCheckpoint 把 state dict 交给后台进程,每个 rank 直接写自己的分片,消除 rank-0 瓶颈
- 进程内重启(inprocess.Wrapper):软故障(NCCL 挂起、未捕获异常)不杀进程,abort 进程组、逐 rank 健康检查、幸存者重新 rendezvous 后从最近 checkpoint 续训
- ftlauncher 进程内作业重启:处理 SIGKILL、OOM 等硬故障,靠心跳超时检测,杀死幸存者并原作业内拉起新 worker
基础设施:p5.48xlarge(8×H100)自管节点组、EFA 3200 Gbps 网络、FSx for Lustre 共享存储与 GPU 节点同可用区以降低恢复时的 checkpoint 读取延迟。附 2-8 节点 H100 基准测试与可复现代码。
「Infra」频道最新
- 强化学习训练成本基准上线,高级 RL 费用首次有参照 — teortaxesTex · 2026-09-17
- PyTorch 大会公布议程:torch.compile 与自定义内核成焦点 — PyTorch · 2026-09-17
- 借助「结构化决策」思路把 DiffusionGemma 推理提速 3-10 倍 — bodonoghue85 · 2026-09-17
- MTS 发布 AI 算力栈交互式图解:从电网到芯片 rack 五层全拆解 — dr_alphalyrae · 2026-09-17
- llama.cpp 跑 Qwen3.8-Flash-Next 的 SSD N-gram 流式参数求助 — Ambitious_Fold_2874 · 2026-09-17
- 贝尔实验室如何错失微芯片:IEEE Spectrum 复盘一段技术史教训 — ArtificialOther · 2026-09-17