Triton GPU 编程系统课:从 H100 架构讲到 FlashAttention
kalyan_kpl · x · 2026-10-05
一份全面的 GPU 编程视频课程,内容覆盖:
- GPU 在计算机中的位置:PCIe、NVLink、服务器与集群架构
- NVIDIA H100 内部:SM、FP32 通道、warp 调度器、tensor core、共享内存
- 线程/warp/block/grid 的层级关系与数据寻址
- 内存体系:SRAM vs DRAM、DDR/GDDR/HBM、缓存、延迟与带宽的权衡
- 优化手段:延迟隐藏、内存合并访问、kernel 融合
- Triton 的设计动机:以 tile 而非线程思考
- memory-bound vs compute-bound、算术强度与 roofline 模型
- Attention 的 N×N 矩阵问题及 FlashAttention 的解法
「Infra」频道最新
- InP 短缺逼行业转向 1μm 激光器与空芯光纤方案 — jwt0625 · 2026-10-05
- 曝 Cloudflare Web Search API 疑为 Exa 封装 — gaganghotra_ · 2026-10-05
- OpenRouter 月度 Token 用量 Top 10 供应商榜单出炉 — stuffyokodraws · 2026-10-05
- Crusoe 披露算力生意组合:五年长约稳收益,推理微调赚高毛利 — AccBalanced · 2026-10-05
- SemiAnalysis 推理榜:AMD MI355X 在多个模型上毛利超英伟达 — AccBalanced · 2026-10-05
- 现在是创业做推理公司的最好还是最坏时机? — AccBalanced · 2026-10-05