从零手写NVFP4内核,GB300上超cuBLAS 4.7%
pranjalssh · x · 2026-08-16
两年前,作者凭一篇「在 H100 上超越 cuBLAS」的博客踏入 GPU 优化领域,还意外掀起一波手写 Blackwell 内核的小热潮:有人用 MXFP8 做到 cuBLAS 的 99%,有人用 BF16 反超,Modular 团队也做了类似工作。如今他发布续作:在 GB300 节点(CUDA 13.1)上,用纯 CUDA + 内联 PTX 从零实现 NVFP4 GEMM,零框架依赖。
- 在经典的 8192×8192×8192 形状上比 cuBLAS 快 4.7%,并给出多个其他形状的成绩,代码已在 GitHub 开源。
- 之所以选 NVFP4,是因为它比其他精度更难:随着张量核指令越来越快,瓶颈转移到整条流水线如何「喂饱」它,最能施展极限 GPU 性能技巧。
- 这次拿出了比 Hilbert 曲线更好的新方案,能精确贴合 NVIDIA 硬件的布局。
- 整个内核 100% 由 Claude 生成(细节后续展开)。
作者希望借此激励大家把内核当作普通代码去掌控,而不是当作黑盒。
「Infra」频道最新
- 若信AGI临近,现在该签5年B300集群合同 — felix_red_panda · 2026-08-16
- 8B 模型为何可从 16GB 缩至 4GB?一文读懂量化原理 — techNmak · 2026-08-16
- 通过启用 Gzip 压缩优化 API 搜索成本 — DanielLockyer · 2026-08-16
- Qwen3.8-27B 在 16GB 显存上 KV 量化性能悬崖问题 — Unnamed-3891 · 2026-08-16
- Nvidia 巨额融资将 CUDA 软件支持变为硬件资产抵押品 — aronchick · 2026-08-16
- 开发者正进入单任务 $0 成本时代,推理价格暴跌 — DynamicWebPaige · 2026-08-16