自研 CUDA kernel 拿下 B200 最快 QR 分解,作者复盘串行依赖破解思路
A_K_Nain · x · 2026-09-27
作者 gau-nernst 参加 GPU MODE 的 QR 分解 kernel 比赛拿下第二名,并开源了全部代码(gau-nernst/gpu-mode-kernels),自称其 panel QR kernel 是目前 B200 上最快的(大幅领先)。
核心难点是 QR 分解的链式依赖:第 n 列的 Householder 反射子依赖此前所有列的结果,外层循环无法并行。他的解法是:
- 用单个 warp 计算 Householder(列归约需单 warp 以避免跨 warp 通信)
- 尾部多列的更新彼此独立,可由多个 warp 并行执行
比赛含 7 种以上矩阵规模(batch 20640、n 最高 2048),还包括 rank-deficient 和 clustered 等特殊生成用例。文章本身也是一次非 LLM 向 GPU kernel 优化的完整工程复盘,作者称 QR 分解主要靠 Codex 边学边写。
「编程与Agent」频道最新
- 傅盛:AI 学会像人一样操作界面,第一次真正帮我维护关系 — FuSheng_0306 · 2026-09-27
- AI 像人一样看屏幕点鼠标,替作者给 50 人写中秋祝福并回复 70 条消息 — FuSheng_0306 · 2026-09-27
- 傅盛让 GPT-6 接管微信发 120 条中秋祝福,全程零出错 — FuSheng_0306 · 2026-09-27
- Astra+Opus 组合编程实测:三段式流水线 82.8 分居首,双模型并非必需 — kevinkern · 2026-09-27
- UT Arlington 论文揭示 Agent「理解-执行差距」:自认完成仍漏需求 — alex_verem · 2026-09-27
- KeySync:把 2FA 验证码搬进 Chrome 工具栏,1.2 秒复制 — aliscodes · 2026-09-27