Pinterest排查3个月:废弃容器致GPU训练任务崩溃
arpit_bhayani · x · 2026-08-04
Pinterest 团队耗时三个月排查导致 GPU 训练任务间歇性崩溃的网络故障,最终发现根因来自一个他们根本没在使用的容器组件。
故障现象
- 运行在 k8s 上的训练任务频繁出现网络丢失并崩溃。
- 系统日志显示 AWS 网络驱动重置(当网络线程连续 5 秒未获得 CPU 时间时会触发自愈机制)。
排查过程
- 常规修复手段(如 huge pages、jemalloc、CPU 绑定)均无效。
- 性能分析发现 Kubelet 在每次崩溃前 CPU 飙升至 6.5%(平时约 1%)。
- 内核当时正在追踪约 70,000 个内存 cgroups,而实际使用的只有 240 个。
根因与修复
- 他们的 GPU 机器使用了 AWS Deep Learning AMI,该镜像会自动启动 Amazon ECS agent。由于实际运行的是 Kubernetes,该 agent 找不到集群便不断崩溃重启,持续泄漏僵尸 memcgs。
- 解决方案:仅需在基础镜像中禁用 ECS agent 的 systemd 单元。
经验教训:基础 OS 镜像附带的隐性负担超乎想象,审计机器上实际运行的 systemd 单元非常必要。
所属事件:Pinterest排查GPU崩溃元凶为废弃容器(2 条相关)→
「Infra」频道最新
- 成立7个月获30亿美元融资,Volta携百亿Anthropic订单入场 — matt_slotnick · 2026-08-04
- 128核CPU集群跑Codex:算力新解法 — BenBajarin · 2026-08-04
- Nscale 向牛津、UCL 等高校赞助百万美元算力 — _rockt · 2026-08-04
- 多模态API图片传输实测:Base64与预签名URL延迟对比 — Nigiva · 2026-08-04
- EON 获 1075 万美元种子轮,拟用卫星激光替代海底光缆 — oyhsu · 2026-08-04
- RTX 3090跑Minimax H3:15秒视频生成耗时22分钟 — pfeifits · 2026-08-04