CUDA matmul 优化教程:从朴素 kernel 一步步逼近 cuBLAS 94% 性能

Abhishekcur · x · 2026-10-01

作者推荐 Si Boehm 的经典 CUDA 优化教程,称这是带他入门 kernel 优化的资源,适合想学写 CUDA kernel 的初学者。

文章以矩阵乘法为载体(GPU 上最重要的算法,占大模型训练/推理几乎全部 FLOPs),从朴素 kernel(309 GFLOPs/s,仅为 cuBLAS 的 1.3%)出发,逐步叠加优化直到达到 cuBLAS FP32 性能的约 94%:

全部代码可在 GitHub 下载,覆盖 coalesced memory access、shared memory、tiling、vectorized loads 等 GPU 性能核心概念,是理解 GPU 实际性能特性的极佳实践材料。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →