TPU与GPU集群通信原理

giffmana · x · 2026-07-15

这篇博客深入讲 TPU 和 GPU 集群里的 collective communication,目标是帮助读者理解训练和推理扩展背后的核心原语。

作者说明,这篇内容会比 FSDP、expert parallelism、data parallelism、model/tensor parallelism 更底层,重点放在:

整体是偏工程与系统的深度阅读,适合想理解大模型扩展栈的人。

所属事件:TPU与GPU集群集体通信深度长文走红(5 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →