手写 CUDA 矩阵乘法内核逼近甚至超越 cuBLAS
社区热议 GPU 编程底层原理学习资源,重点推荐 Simon Boehm 的经典 CUDA 优化教程:以矩阵乘法为载体,从朴素 kernel 一步步优化,最终达到 cuBLAS 约 94% 的性能。另有开发者手写单精度矩阵乘法(SGEMM)内核,结果与 cuBLAS 逐位相同,并在 16384x16384 及更大方阵上局部跑赢 cuBLAS。
2026-10-01 ~ 2026-10-02 · 3 条相关
- CUDA matmul 优化教程:从朴素 kernel 一步步逼近 cuBLAS 94% 性能 — Abhishekcur · 2026-10-01
- 推荐一份 GPU 编程内部原理的宝藏学习资源 — goyal__pramod · 2026-10-02
- 手写 CUDA 矩阵乘法内核:16384 阶矩阵局部跑赢 cuBLAS — goyal__pramod · 2026-10-02