微软 HotChips 演示揭示 AI 集群带宽瓶颈
bookwormengr · x · 2026-08-31
在 HotChips 会议上,微软的演示揭示了 AI 集群架构中存在的“带宽墙”:本地加速器之间带宽为 6-7 400G(非交换网络),而不同计算托盘/机架的加速器之间仅 2 400G(交换网络)。虽然微软统一使用了协议且采用片上 NIC,但这一带宽差异巨大。技术上可以通过重新分配每加速器 28 个 400G 链路来消除此墙,但这取决于是否需要超过 4 个节点的张量并行。
「Infra」频道最新
- MiniMax H3 Max 视频生成速度超越播放速度 — isidentical · 2026-08-31
- 佐治亚州力挺数据中心:反驳耗水耗电与账单上涨谬论 — sudoraohacker · 2026-08-31
- 企业级 Agent 需混合云协调层,单一公有云难承重负 — sanjaykalra · 2026-08-31
- 结合 SKILL.state,我在单张 5090 上跑出 200k 上下文编码 — Ok-Shower7286 · 2026-08-31
- 「3 个月涌现 3 个 agent 文明」,边际 token 买家已不是人类 — arthurcolle · 2026-08-31
- Sail 开源 HTDYM 工具:解析哪款芯片性价比最高 — cgarciae88 · 2026-08-31