GPU 慢 5% 推理没事训练致命:训练与推理健康检查逻辑相反
AccBalanced · x · 2026-09-06
一条被广泛转发的运维经验:同一块 GPU 慢 5%,对推理无所谓,对训练是灾难,因此两类负载的供给和健康检查流程几乎完全相反。
- 训练:同步紧耦合,数千张 GPU 一起做 all-reduce,最慢的卡决定整体节奏——一颗掉队卡、一条抖动的 NVLink、一个内存错误爬升的 GPU 都会让整个 job 买单。健康工作前置:上线前烧机、跑集合通信带宽测试、检查热余量与链路健康,把边缘节点剔除;中途死节点意味着回滚到 checkpoint,所有 GPU 损失数小时进度
- 推理:副本松耦合、基本无状态,单卡变慢只影响少数请求,运维逻辑是事后弹性扩缩容而非事前排查
结论:给训练集群做准入式健康检查,给推理集群做弹性调度,两套体系不能混用。
「Infra」频道最新
- Agent 时代 KV cache 挤爆 HBM,容量不足拖垮有效带宽 — AccBalanced · 2026-09-06
- 分析师测算混合键合 HBM 假想市场:年超 30 亿次 D2D 应用 — zephyr_z9 · 2026-09-06
- Ollama CEO:企业 80-90% token 将由开源模型承担,仅占成本 10-20% — victor_explore · 2026-09-06
- SemiAnalysis 算账:Nvidia 将 Rubin Ultra HBM 从 12-Hi 降为 8-Hi 的原因 — AccBalanced · 2026-09-06
- Substack 发布 Hot Chips 2026 投资视角回顾分析 — jwt0625 · 2026-09-06
- 训练前预判发散概率,新研究助大模型训练省算力 — burkov · 2026-09-06