从朴素实现到共享内存分块:一篇 CUDA GEMM 提速实战全记录
abhijithneil · x · 2026-09-22
作者 Anshuman Mishra 发布《How to make your models fast》系列第 4 篇,一份优化 CUDA GEMM(通用矩阵乘法)的完整工作日志,代码开源于 kernels/gemm/。
内容脉络:
- 从最朴素的一线程一输出点积实现起步,逐项统计 FLOPs(2MNK-MN)与内存请求量,指出性能瓶颈在访存而非计算
- 引入 online softmax 概念,实现 kernel 并量化内存与 FLOPs 上的收益
- 应用合并内存访问(coalesced memory)模式,再次量化 FLOPs、通信与内存的改善
- 通过共享内存复用 tile、每线程计算多个输出,逐步把矩阵乘法做快
文章方法论清晰:每一步优化都先量化问题、再实现、再用数字验证收益,适合想深入推理工程/ CUDA kernel 优化的开发者照着练。
「Infra」频道最新
- LFM2.5 端侧评测登顶:2.32GB 内存、8 秒延迟,39 款小模型中并列第一 — maximelabonne · 2026-09-22
- AMD 工程师受 gemm ladder 启发发布 GEMM 优化教程博客 — simran_s_arora · 2026-09-22
- 网友称 Meta 未在 WhatsApp 推 Muse 因硬件撑不起 20 亿用户 — zephyr_z9 · 2026-09-22
- Terraform 沙漠试验场实现太阳能直驱量产高纯甲醇与 99.9% 氢气 — GabGarrett · 2026-09-22
- AMD 发布 Helios GPU 教学 GEMM 调优指南:432GB HBM4、23TB/s 带宽实测 — simran_s_arora · 2026-09-22
- 做抽屉拉手起家:King Slide 四年涨 3000% 成 AI 隐形赢家 — CatAstro_Piyush · 2026-09-22