手写 CUDA 矩阵乘法内核:16384 阶矩阵局部跑赢 cuBLAS

goyal__pramod · x · 2026-10-02

作者为实现通用张量归约 C++ 库做可行性验证,手写了一个单精度矩阵乘法(SGEMM)CUDA 内核,结果与 cuBLAS 逐位相同,在 16384x16384 及更大的方阵上比 cuBLAS 快几个百分点,小矩阵则慢几个百分点,性能随功耗档、时钟、内存速度和编译器波动。

内核采用两个较少被讨论的技巧:

文章覆盖问题设定、实现概览、基准测试方法与完整代码,后续还将发布内核逐层拆解文章。

所属事件:手写 CUDA 矩阵乘法内核逼近甚至超越 cuBLAS(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →