Grok 解析 DeepSeek 训练:为何用 DualPipe+ZeRO-1 而非 ZeRO-3
TheZachMueller · x · 2026-09-23
- Grok 在回复中解释 DeepSeek 在 2048 块 H800 上的并行策略选择:跨节点 EP 的 all-to-all 通信接近 1:1 的计算通信比,FSDP/ZeRO-3 + EP 虽可达到相近速度,但 ZeRO-3 额外的参数 all-gather 流量在有限 NVLink/IB 下难以隐藏。
- DualPipe(16 路双向流水线)专门把 dispatch/combine 通信与前后向的 attention/MLP 及流水线气泡重叠,实现近零开销;配合重计算、FP8 等显存优化,ZeRO-1 + PP 即够用,无需 TP。
- 对理解大规模训练中并行策略与通信-计算权衡很有参考价值。
「Infra」频道最新
- fmgo 开源:在 Go 中调用苹果端侧 Foundation Models,免 CGO 免 Swift — Super_Run_8466 · 2026-09-23
- 华为发布 Peerium 计算架构:百万级处理器如同一台计算机 — Dr_Singularity · 2026-09-23
- Epoch AI:同等性能 AI 成本每季降 47%,降价速度史无前例 — daveholtz · 2026-09-23
- M5 Ultra 本地跑大模型实测:预填充快 4 倍,但功耗翻倍 — DigitalguyCH · 2026-09-23
- $500 收 7 台 OptiPlex 组建物理机 Agent 集群,无盘 netboot 防翻车 — colinmcnamara · 2026-09-23
- Signal65 实测:AMD MI355X 大上下文下性能达 B200 的 2.25 倍 — ryanshrout · 2026-09-23