AI agent 调优 Triton kernel,翻转 grid 顺序换来 1.29x 推理提速

zmkzmkz · x · 2026-10-11

开发者 Erland Hilman Fuadi 分享了在 AMD MI210 上优化推理 GEMM 的过程:他让 GEAK(一个自动编写与调优 GPU kernel 的 agent)针对 decode 阶段 M 很小(164 token)、权重矩阵很大的瓶颈场景跑了两轮调优。

结果:加权加速比第一轮从 1.00x 提升到 1.23x,第二轮达到 1.29x。第一轮产出了 Triton split-K kernel、重调 tile 尺寸、M=1 的 GEMV 路径等常规优化。

有趣的发现:profiling 显示 M=4/16 时权重流读取已接近显卡上限(0.91.19 TB/s),但 M=64 时只有约 625 GB/s——因为 tile 过大(BLOCKM=64、150+ 寄存器),104 个 CU 上只启动了 96 个 workgroup。

第二轮的关键技巧:改用更小的 M tile 后,通过翻转 Triton kernel 中 programid 的轴顺序(把 pidm 放到最慢的维度),让同一 (N, K) 权重块的多个 M tile 在启动顺序上相邻,从而提高 L2 命中率、减少权重复读。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →