AWS 实测 NVRx 容错训练:同步 checkpoint 曾耗掉 40% 墙钟时间

AWS ML Blog · rss · 2026-09-17

AWS ML Blog 发布在 Amazon EKS 上用 NVIDIA Resiliency Extension (NVRx) 做大规模容错分布式训练的完整方案。

问题:大训练跑数天跨多节点,故障不可避免;单个 GPU 故障会让 NCCL 超时级联拖垮健康 worker;同步 checkpoint 阻塞所有 rank 的 I/O,在该集群规模下曾消耗高达 40% 的总墙钟时间。

NVRx 三层独立容错能力(pip 安装即可,不改模型和训练代码):

基础设施:p5.48xlarge(8×H100)自管节点组、EFA 3200 Gbps 网络、FSx for Lustre 共享存储与 GPU 节点同可用区以降低恢复时的 checkpoint 读取延迟。附 2-8 节点 H100 基准测试与可复现代码。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →