AMD 发布 Helios GPU 教学 GEMM 调优指南:432GB HBM4、23TB/s 带宽实测
simran_s_arora · x · 2026-09-22
AMD ROCm 团队联合研究者发布博客,仿照 Simon Boehm 的 CUDA GEMM 经典优化阶梯,为新一代 Helios GPU 构建了一套渐进式 BF16 GEMM kernel 教学阶梯,帮助开发者理解新硬件特性对 kernel 设计的影响。
关键信息:
- 硬件规格:Helios 单卡 432 GB HBM4、23 TB/s 带宽、40 PFLOPs FP4 算力;256 个 WGP 分布在 8 个 XCD 上,每个 WGP 有 320KB LDS;机架内 72 卡互联,3.6 TB/s 扩展带宽与统一虚拟内存抽象,适合长上下文 agent 工作负载。
- 新架构特性:基于 DMA 的异步 HBM 到共享内存数据搬运(TDM)、更简化的缓存层级、每 wave 32 线程的新线程层级、细粒度同步机制、workgroup-cluster 启动与组播。
- 实现框架:全部 kernel 用 HipKittens 框架(AMD 版 CUDA kernel 抽象)实现,代码与示例开源在 GitHub。
「Infra」频道最新
- LFM2.5 端侧评测登顶:2.32GB 内存、8 秒延迟,39 款小模型中并列第一 — maximelabonne · 2026-09-22
- AMD 工程师受 gemm ladder 启发发布 GEMM 优化教程博客 — simran_s_arora · 2026-09-22
- 网友称 Meta 未在 WhatsApp 推 Muse 因硬件撑不起 20 亿用户 — zephyr_z9 · 2026-09-22
- Terraform 沙漠试验场实现太阳能直驱量产高纯甲醇与 99.9% 氢气 — GabGarrett · 2026-09-22
- 从朴素实现到共享内存分块:一篇 CUDA GEMM 提速实战全记录 — abhijithneil · 2026-09-22
- 做抽屉拉手起家:King Slide 四年涨 3000% 成 AI 隐形赢家 — CatAstro_Piyush · 2026-09-22