自研 CUDA kernel 拿下 B200 最快 QR 分解,作者复盘串行依赖破解思路

A_K_Nain · x · 2026-09-27

作者 gau-nernst 参加 GPU MODE 的 QR 分解 kernel 比赛拿下第二名,并开源了全部代码(gau-nernst/gpu-mode-kernels),自称其 panel QR kernel 是目前 B200 上最快的(大幅领先)。

核心难点是 QR 分解的链式依赖:第 n 列的 Householder 反射子依赖此前所有列的结果,外层循环无法并行。他的解法是:

比赛含 7 种以上矩阵规模(batch 20640、n 最高 2048),还包括 rank-deficient 和 clustered 等特殊生成用例。文章本身也是一次非 LLM 向 GPU kernel 优化的完整工程复盘,作者称 QR 分解主要靠 Codex 边学边写。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →