MLC 推出 Blackwell GPU 执行模型教程:线程层级、内存与 TMA 一文讲透
blaizedsouza · x · 2026-09-19
MLC(mlc.ai)发布 GPU 执行模型章节,面向 MLSys 的现代 GPU 编程教学。
- 线程层级:从 thread、warp、warpgroup、CTA、cluster 到 grid,不同协作尺度对应不同操作——如 TMA 拷贝由单线程发起,TMEM 累加器需 4 个 warp 读取,2-CTA 协作 MMA 跨两个 CTA。
- 内存体系:GMEM、SMEM、TMEM 与寄存器各有容量/延迟/访问范围权衡,cluster 还可通过 DSMEM 跨 CTA 访问共享内存。
- 硬件引擎分工:CUDA 核负责地址计算与控制流,Tensor Core 做矩阵运算,TMA 异步搬数据。
- 以 Blackwell SM 架构切入,最后用 GEMM 数据流水线演示计算与数据搬运的重叠,保持多引擎满载。
「Infra」频道最新
- Cosmos DB 团队 VLDB 论文:更优调度策略年价值可达上亿美元 — blaizedsouza · 2026-09-19
- Qwen 3.8 27B 单卡 RTX 5090 本地跑通全代码动画制作 — Acceptable-Object390 · 2026-09-19
- Compiler Explorer 年编译 9200 万次,创始人详解背后架构 — blaizedsouza · 2026-09-19
- 爆料称 Meta 大量租用虚拟机跑 Muse,CPU 需求将暴涨 — zephyr_z9 · 2026-09-19
- Cloudflare 缩减一致性哈希环省下 100TB 内存 — blaizedsouza · 2026-09-19
- Higgsfield 开源万亿参数训练框架,GPU 容错编排引关注 — higgsfield-ai · 2026-09-19