AI agent 调优 Triton kernel,翻转 grid 顺序换来 1.29x 推理提速
zmkzmkz · x · 2026-10-11
开发者 Erland Hilman Fuadi 分享了在 AMD MI210 上优化推理 GEMM 的过程:他让 GEAK(一个自动编写与调优 GPU kernel 的 agent)针对 decode 阶段 M 很小(164 token)、权重矩阵很大的瓶颈场景跑了两轮调优。
结果:加权加速比第一轮从 1.00x 提升到 1.23x,第二轮达到 1.29x。第一轮产出了 Triton split-K kernel、重调 tile 尺寸、M=1 的 GEMV 路径等常规优化。
有趣的发现:profiling 显示 M=4/16 时权重流读取已接近显卡上限(0.91.19 TB/s),但 M=64 时只有约 625 GB/s——因为 tile 过大(BLOCKM=64、150+ 寄存器),104 个 CU 上只启动了 96 个 workgroup。
第二轮的关键技巧:改用更小的 M tile 后,通过翻转 Triton kernel 中 programid 的轴顺序(把 pidm 放到最慢的维度),让同一 (N, K) 权重块的多个 M tile 在启动顺序上相邻,从而提高 L2 命中率、减少权重复读。
「编程与Agent」频道最新
- Polyphonic 更新:一个窗口统筹 Claude Code 与 Codex 多智能体 — RileyRalmuto · 2026-10-11
- Hamel Husain 访谈:用「模拟」做 Agent 评测,警惕模型识破模拟 — HamelHusain · 2026-10-11
- Anthropic 发布 AI 原生 SDLC 手册:意图版本化、Skills 管策略、Hooks 做强制 — bibryam · 2026-10-11
- 开发者10天复刻老东家Gitpod,引出AI训练数据版权归属难题 — iamtrask · 2026-10-11
- 开源工具把网站/App 反向工程成 API,供 Agent 直接调用省 token — Scary-Philosopher-77 · 2026-10-11
- AI 提速写码后 QA 成瓶颈:1 月 64% 缺陷靠质检拦截 — alex_verem · 2026-10-11