CUDA matmul 优化教程:从朴素 kernel 一步步逼近 cuBLAS 94% 性能
Abhishekcur · x · 2026-10-01
作者推荐 Si Boehm 的经典 CUDA 优化教程,称这是带他入门 kernel 优化的资源,适合想学写 CUDA kernel 的初学者。
文章以矩阵乘法为载体(GPU 上最重要的算法,占大模型训练/推理几乎全部 FLOPs),从朴素 kernel(309 GFLOPs/s,仅为 cuBLAS 的 1.3%)出发,逐步叠加优化直到达到 cuBLAS FP32 性能的约 94%:
- 合并全局内存访问(coalescing):8.5%
- 共享内存缓存(smem caching):12.8%
- 一维/二维 block tiling:36.5% → 68.7%
- 向量化内存访问:78.4%
- 自动调参 + warptiling:93.7%
全部代码可在 GitHub 下载,覆盖 coalesced memory access、shared memory、tiling、vectorized loads 等 GPU 性能核心概念,是理解 GPU 实际性能特性的极佳实践材料。
「Infra」频道最新
- Anthropic S-1 文件披露:博通 420 亿美元融资 + 1252 亿 TPU 算力租约闭环 — roll0ver · 2026-10-01
- 曝 SpaceX AI 部门夏季洽谈向微软出租算力 — pstAsiatech · 2026-10-01
- HF 工程师称 SGLang 成为其默认推理框架选择 — TheZachMueller · 2026-10-01
- Cloudflare 数据平台更名 Basin 并正式 GA:Iceberg 上的 serverless 分析 — ritakozlov · 2026-10-01
- Cloudflare 生日周 Day 4 集中发布:K2 流服务、AI Search GA 等八项 — threepointone · 2026-10-01
- 开源 Strata:16GB 显存本地跑 125B 的 Qwen3.8-Flash-Next — evilsocket · 2026-10-01