Google DeepMind 长文详解分片矩阵乘法:万卡 TPU 训练的通信理论
zacharynado · x · 2026-09-16
Google DeepMind 团队(Jacob Austin、Roy Frostig、Reiner Pope 等)发布《How To Scale Your Model》系列第三篇,系统讲解大模型训练中跨设备的分片(sharding)矩阵乘法。
- 核心问题:LLM 基本由矩阵乘法构成,参数放不进单卡 HBM 时必须拆分到上万块 TPU/GPU 上,如何切分直接决定计算效率
- 作者基于 TPU 通信原语的成本,建立了一套简洁的分片矩阵乘法理论,把 sharding 决策变成可推演的计算
- 覆盖集合通信操作(collective operations)与分区记号体系,并区分训练(降低 step time)与推理(降低延迟)的不同扩容动机——即使能塞进更少芯片,也常为速度而扩到更大拓扑
这是理解大规模分布式训练/推理基础设施的优质系统教程。
「Infra」频道最新
- 开发者用 GPT-6 重写 Radish:在 Durable Object 里跑 Redis — whoiskatrin · 2026-09-16
- Anthropic 落地首个澳洲数据中心,昆士兰项目估值达 319 亿美元 — nordicinst · 2026-09-16
- 曼彻斯特大学用 NVIDIA Earth-2 两日训练出英国全域空气污染预报模型 — NVIDIA Blog · 2026-09-16
- RX 7900 XTX 本地跑 GPT-OSS-20B 比 R9700 快 30% — glenbeer · 2026-09-16
- 实测爆料:Rubin NVL72 每 MW 吞吐已达 Blackwell 7 倍,官方只敢讲 3 倍 — sudoraohacker · 2026-09-16
- 马斯克解释为何必须建 Terafab:地缘风险加产能天花板 — elonmusk · 2026-09-16