从 4 到 285 TFLOP/s:Blackwell 极致 GEMM 内核系列开篇
HanGuo97 · x · 2026-09-05
Luke D. Huang 发布系列博客第一部:用 CuTeDSL 在 B200 上写 9 个逐步优化的 BF16 GEMM 内核,最终在多个矩阵维度达到 cuBLAS 的 99% 性能。本篇(19 分钟阅读)覆盖:
- Kernel 1(朴素 matmul):每线程处理一个输出元素,遍历整个 K 维,基线 4 TFLOP/s。
- CuTeDSL 心智模型:如何描述数据布局、切分 tile、映射到 GPU 操作。
- Kernel 2(tensor core + TMA + TMEM):每 CTA 处理一块 C,用 TMA 和 barrier 把 A/B tile 搬进 shared memory,发射 tcgen05 MMA 指令累加到 TMEM,经寄存器写回全局内存,提升到 155 TFLOP/s。
- Kernel 3(swizzling):发现 shared memory bank 冲突成为瓶颈,仅改变内存布局让并发读分散到不同 bank,提升到 285 TFLOP/s。
作者过去半年深入 GPU 与性能工程,这是记录「写出光速 GEMM 内核」全过程的第一部分。
「Infra」频道最新
- Jason 拿《The New Kingmakers》佐证:免费 token 正重塑算力格局 — AccBalanced · 2026-09-05
- GPU 并行沙箱:递归自我改进的算力原语 — AAAzzam · 2026-09-05
- SemiAnalysis 联手 vLLM 推出 AgentX 基准,直测多轮长上下文 Agent 流量 — AccBalanced · 2026-09-05
- Zilliz CTO 解读 Notion 向量基建两年史:成本峰值后降 90% — J_Luan_ · 2026-09-05
- 36B 参数 MoE 开源模型上线:仅 4B 激活即可本地跑 — rupspace · 2026-09-05
- Agent 记忆越活越久,单一热索引架构开始让工程师不安 — Cautious_Bit_8521 · 2026-09-05