ezyang 深度解析:用 Roofline 模型在 Hopper 上训练 DeepSeek-V3
ezyang · x · 2026-10-03
PyTorch 核心开发者 Edward Z. Yang 发布 DeepSeek-V3 系列第三篇,用 Roofline 分析在 H800 集群上复现 DSv3 训练配置。
核心内容:
- 前两部分已确定一种能在 2048 卡 H800 集群上装下 DSv3 的并行/激活检查点/低精度组合,且结果与 DeepSeek 官方选择高度一致——因为架构固定后在原厂硬件上求最优配置,自然会收敛到同样的方案
- 本篇引入 Roofline 分析:总 FLOPs 固定,系统性能瓶颈主要在分布式通信(类比 kernel 的 compute/bandwidth bound)
- 关键结论:Roofline 分析显示 FSDP (ZeRO-3) 对 DSv3 是坏选择,会打满 InfiniBand 带宽成为通信瓶颈,因此不必真的搭建两套系统做全尺寸集群基准就能提前排除
- 文章还讨论了"光速"(speed of light) 上界的计算方法,以及 infra 与架构 codesign(如专家稀疏度)这一后续议题
「Infra」频道最新
- vLLM×Cohere 多伦多 meetup 详情:路线图、投机解码与 agentic RL 扩展 — cohere · 2026-10-03
- Cohere 联手 vLLM 在多伦多做开源推理主题 meetup — cohere · 2026-10-03
- 传台积电评估德州建新厂,扩大 2650 亿美元美国布局 — Beth_Kindig · 2026-10-03
- 离散扩散新方法让 LLM 推理无损提速,可直接替换现有训练管线 — Cohere · 2026-10-03
- 花 4500 美元买 GPU 跑准前沿模型,网友吐槽「不能让人跑得太便宜」 — marian_nmt · 2026-10-03
- 90% 算力价值归于存量芯片巨头,难再现 OpenAI 式新贵 — menhguin · 2026-10-03