手写 CUDA 矩阵乘法内核:16384 阶矩阵局部跑赢 cuBLAS
goyal__pramod · x · 2026-10-02
作者为实现通用张量归约 C++ 库做可行性验证,手写了一个单精度矩阵乘法(SGEMM)CUDA 内核,结果与 cuBLAS 逐位相同,在 16384x16384 及更大的方阵上比 cuBLAS 快几个百分点,小矩阵则慢几个百分点,性能随功耗档、时钟、内存速度和编译器波动。
内核采用两个较少被讨论的技巧:
- Hilbert 曲线调度线程块:最大化 L2 缓存命中率;
- warp tile 局部同步:避免整个线程块级别同步,改为先在半块、再在四分之一块范围同步。
文章覆盖问题设定、实现概览、基准测试方法与完整代码,后续还将发布内核逐层拆解文章。
所属事件:手写 CUDA 矩阵乘法内核逼近甚至超越 cuBLAS(3 条相关)→
「Infra」频道最新
- 9 月本地模型盘点:27B 塞进 5.9GB、手机级 35B 等数十款发布 — vramkickedin · 2026-10-02
- Liquid AI 决策模型 D1 上线 OpenRouter:返回带概率的结构化答案,输入每百万 token 仅 4 美分 — maximelabonne · 2026-10-02
- 少年流片芯片、挖英伟达高管:又一位低调造芯片的年轻人 — ai · 2026-10-02
- huggingface_hub v2.1.0 发布:下载最高提速 17 倍,Jobs 支持重试与端口暴露 — huggingface · 2026-10-02
- 自托管 LLM 到底值不值?工程师征集团队真实成本账 — One_Mention_5385 · 2026-10-02
- Gemini 4 未发布先遭群嘲,TPU 算力优势被低估 — haider1 · 2026-10-02