AMD Helios 用 72 张 MI455X 实现 260 TB/s 整柜带宽
SumitGup · x · 2026-07-25
AMD 用 72 张 MI455X 把一整柜 GPU 做成“单机”
这条帖和配图在拆解 AMD 的 Helios rack-scale AI 平台:整柜配置为 72 张 MI455X GPU、12 颗 Broadcom Tomahawk 6、36 条并行网络平面,实现 每 GPU 3.6 TB/s 的双向 scale-up 带宽,整柜聚合带宽达到 260 TB/s。
- UALoE 负责定义 GPU 之间如何通信,包括内存读写、事务顺序和流量在 36 条平面上的分发。
- ESUN 负责底层以太网 fabric,处理转发、流控、拥塞管理、链路重试和小消息传输。
- 目标是让 31 TB 的 HBM4 虽然物理上分散在 72 张卡上,但逻辑上像一台 共享内存的紧耦合计算机。
配图还展示了这套架构把 UALoE、OCP SUE 和 ESUN 叠成一层以太网式 scale-up 协议栈,并列出 AMD、Broadcom、Cisco、Meta、Microsoft、NVIDIA 等作为 ESUN founding members。
所属事件:AMD发布MI455X与Helios,AI算力竞争升至机架级(9 条相关)→
「Infra」频道最新
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11