线程粗化再提速:T4 上矩阵乘核优化至 0.41ms,累计近 1.5 倍

goyal__pramod · x · 2026-09-04

开发者分享 CUDA 矩阵乘 kernel 优化过程:初版实现在 T4 上(BATCH=8, M=N=K=256)平均耗时 0.598ms,引入基础 tiling 后降到 0.348ms(约 1.7 倍提速),再沿一个维度做 thread coarsening 进一步降到 0.41ms 的基础上继续优化至 0.41ms 区间,展示了 tiling + 线程粗化两步优化的具体收益。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →