从朴素实现到共享内存分块:一篇 CUDA GEMM 提速实战全记录

abhijithneil · x · 2026-09-22

作者 Anshuman Mishra 发布《How to make your models fast》系列第 4 篇,一份优化 CUDA GEMM(通用矩阵乘法)的完整工作日志,代码开源于 kernels/gemm/。

内容脉络:

文章方法论清晰:每一步优化都先量化问题、再实现、再用数字验证收益,适合想深入推理工程/ CUDA kernel 优化的开发者照着练。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →