微软 HotChips 演示揭示 AI 集群带宽瓶颈

bookwormengr · x · 2026-08-31

在 HotChips 会议上,微软的演示揭示了 AI 集群架构中存在的“带宽墙”:本地加速器之间带宽为 6-7 400G(非交换网络),而不同计算托盘/机架的加速器之间仅 2 400G(交换网络)。虽然微软统一使用了协议且采用片上 NIC,但这一带宽差异巨大。技术上可以通过重新分配每加速器 28 个 400G 链路来消除此墙,但这取决于是否需要超过 4 个节点的张量并行。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →