CDNA GPU kernel 难在指令调度,开发者呼吁直接写 AMD 汇编
salykova_ · x · 2026-09-19
被引用的 @nirw4nna 指出,在 CDNA 架构 GPU 上写 kernel 最难搞对的是指令调度(instruction scheduling):很难划清一个区域,手动安排 VALU + MATRIX 指令的均衡混合,因为编译器总想按自己的方式来。他感叹合适的编程模型也许是「带一点语法糖的汇编器」。salykova 由此提议:是时候直接在 AMD GPU 上用汇编写高性能 kernel 了,或至少让写干净汇编代码变得更容易,并表示要试试看。
「Infra」频道最新
- SemiAnalysis:跑 Kimi K3 时 AMD Mi355X 每吉瓦利润率 53.6%,反超英伟达 — m2saxon · 2026-09-19
- 数据中心大扩张:一场押注公众会无限使用 AI 的豪赌 — Dullydude · 2026-09-19
- 用 Lambda MicroVM 搭跨设备 AI 编程环境,作者日常使用 — blaizedsouza · 2026-09-19
- NVIDIA 推出 PAIR:把多台电脑连接起来跑本地 AI — Matthew Berman · 2026-09-19
- 12GB 显存跑 128k 上下文 MoE:两天实测数据与意外结论 — HomoAgens1 · 2026-09-19
- Joseph Suarez 用消费级显卡 5 小时在仓库跑出 SOTA — yacineMTB · 2026-09-19