Krea 2 训练幕后:张量核心利用率与崩溃哲学
AI Engineer · youtube · 2026-08-19
Krea.ai 工程师 Gabriel Jorge Menezes 分享了在数千 GPU 上从零训练 Krea 2 的基础设施经验。核心要点包括:
- 监控指标:GPU 利用率具有误导性,应追踪张量核心(Tensor Core)利用率;需自建 InfiniBand 计数器监控节点通信。
- 硬件管理:温度超过 78 度的 GPU 直接更换,以免降频影响集群。
- 容错策略:大规模训练中崩溃常发生且静默失败,策略是“让它崩溃”,重试往往能稳定运行 24 小时。
- 存储与调度:通过快速文件系统(30秒写入1TB)进行激进检查点;训练优先级高于推理,通过伪装 Kubernetes 节点逐步迁移推理负载。
「Infra」频道最新
- 推理时代云厂商的核心竞争力:每瓦收入比 — BenBajarin · 2026-08-19
- Code.Storage 开放注册:专为 AI Agent 设计的无限制 Git 基础设施 — dsp_ · 2026-08-19
- 冷知识:熔岩灯如何帮助保护互联网数据安全 — dreamwieber · 2026-08-19
- EC2 竞价实例翻车史:999 美元一小时的惨痛教训 — lauriewired · 2026-08-19
- Engy 开放 TEE Worker 节点,支持自带 GPU 训练前沿模型 — markjeffrey · 2026-08-19
- Apache Arrow 修复记:别信注释,看实测 — Abhishekcur · 2026-08-19