AMD 发布 Helios GPU 教学版 GEMM 优化阶梯:从基线到峰值性能
salykova_ · x · 2026-09-26
AMD 官方博客联合 Caltech、Stanford、Together AI 及社区贡献者,发布了一份基于 HipKittens 的 MI455X(Helios 架构)教学版 GEMM 优化指南。
要点:
- Helios GPU 规格:432 GB HBM4、23 TB/s 带宽、40 PFLOPs FP4 算力,单机架 72 卡、3.6 TB/s 扩展带宽,面向前沿大模型与长上下文 agent 负载。
- 文章从基线 kernel 出发,逐级引入异步内存传输、Tensor Data Movers(TDM)、workgroup-cluster multicast 等优化,展示每一步对 kernel 性能的影响。
- 灵感来自 Simon Boehm 的经典 CUDA GEMM 优化 worklog,全部代码与性能剖析公开,供 kernel 开发者学习 Helios 新硬件特性如何影响 kernel 设计。
对 AMD 生态的 GPU kernel 开发者是一份少见的高质量系统教程。
「Infra」频道最新
- 16GB 内存的本地小模型,还要多久追上云端水准? — Aggravating-Push-207 · 2026-09-26
- Vpipe 对比 Draw Things:Mac 本地生图快 22-24%,2K 下更稳定 — TgoAI · 2026-09-26
- Terafab 启动招聘:目标年产 1TW 芯片,剑指轨道 AI 算力 — seanmcdonaldxyz · 2026-09-26
- 从单节点到百万节点:作者分享 LLM 推理扩容实践博客 — abhijithneil · 2026-09-26
- 三星联合牛津北大推出 TrOPD,让端侧小模型继承大模型推理 — jiqizhixin · 2026-09-26
- LLM API 该按量付费还是承诺用量?真实采购决策的三个问题 — LeviYagami · 2026-09-26