手写 CUDA 矩阵乘法内核逼近甚至超越 cuBLAS

社区热议 GPU 编程底层原理学习资源,重点推荐 Simon Boehm 的经典 CUDA 优化教程:以矩阵乘法为载体,从朴素 kernel 一步步优化,最终达到 cuBLAS 约 94% 的性能。另有开发者手写单精度矩阵乘法(SGEMM)内核,结果与 cuBLAS 逐位相同,并在 16384x16384 及更大方阵上局部跑赢 cuBLAS。

2026-10-01 ~ 2026-10-02 · 3 条相关