线程粗化再提速:T4 上矩阵乘核优化至 0.41ms,累计近 1.5 倍
goyal__pramod · x · 2026-09-04
开发者分享 CUDA 矩阵乘 kernel 优化过程:初版实现在 T4 上(BATCH=8, M=N=K=256)平均耗时 0.598ms,引入基础 tiling 后降到 0.348ms(约 1.7 倍提速),再沿一个维度做 thread coarsening 进一步降到 0.41ms 的基础上继续优化至 0.41ms 区间,展示了 tiling + 线程粗化两步优化的具体收益。
「Infra」频道最新
- Hermes 上线本地后端,一键运行 Unsloth GGUF 量化模型 — danielhanchen · 2026-09-04
- MLX-Serve v26.9.1 发布:贴一张截图即可一键跑 Qwen Flash 模型 — TheMoonMidas · 2026-09-04
- 开发者盛赞 Cloudflare Wrangler 是最友好的 Agent 基础设施 CLI — dinasaur_404 · 2026-09-04
- LLM Token 支出指数跌至 0.97 美元,较夏峰值腰斩 — churchkey · 2026-09-04
- Cerebras 推出 CS-4 与 WSE-3 Turbo,宣称比 GPU 快 30 倍 — airesearch12 · 2026-09-04
- The Next Token 播客:Michelle Chen 谈大规模 AI 推理与开放权重 — ritakozlov · 2026-09-04