从 4 到 285 TFLOP/s:Blackwell 极致 GEMM 内核系列开篇

HanGuo97 · x · 2026-09-05

Luke D. Huang 发布系列博客第一部:用 CuTeDSL 在 B200 上写 9 个逐步优化的 BF16 GEMM 内核,最终在多个矩阵维度达到 cuBLAS 的 99% 性能。本篇(19 分钟阅读)覆盖:

作者过去半年深入 GPU 与性能工程,这是记录「写出光速 GEMM 内核」全过程的第一部分。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →