Crusoe 自愈式训练:GPU 半路挂掉,15 分钟内无人值守恢复
AI Engineer · youtube · 2026-10-04
Crusoe 工程团队在 AI Engineer World's Fair 演讲中介绍其 Managed Slurm on Kubernetes 架构,解决大规模训练中硬件故障不可避免的问题。
核心内容
- Slurm 擅长 gang scheduling、拓扑感知和熟悉的 sbatch 工作流,但在动态资源、节点健康检查和可观测性上有短板;Kubernetes 恰好补齐这些缺口,且双方团队都无需改变工作方式。
- 演示 AutoClusters 对 XID 79 GPU 错误的全自动修复流程:通知 → drain → 替换节点 → 重新入队 → 从 checkpoint 恢复。
- 现场杀掉训练中 GPU,系统在无人工干预下 15 分钟内恢复训练。
- 还演示了训练与推理之间按需求动态共享 GPU,以及一键部署 Slurm。
配套资源包括 Managed Slurm 文档、自愈式 PyTorch 训练博客和开源的 Slinky Slurm-on-Kubernetes operator。
「编程与Agent」频道最新
- 开源 local-codex-proxy:在 Codex/ChatGPT 里跑本地模型 — TheZachMueller · 2026-10-04
- arXiv论文:自改进分支混合优化Agent Harness,奥数相对提升34.8% — rohanpaul_ai · 2026-10-04
- Meta等新论文:分支化自优化让Agent Harness精度大增 — rohanpaul_ai · 2026-10-04
- 开源 Claude Code 技能:让 Agent 自动跑邮件、LinkedIn、WhatsApp 外联 — TeslaLegacy · 2026-10-04
- AI 能力暴涨后单元测试是去是留,开发者圈激辩测试价值 — blelbach · 2026-10-04
- TypeScript 核心成员入职 Cursor 首月:266 个 PR、528 万行删除 — Vjeux · 2026-10-04