哈佛 CS249r 新书性能工程章节:覆盖图编译、融合与 CUDA 流剖析

blaizedsouza · x · 2026-09-14

一位 GPU 编程学习者在「Day 252/365」打卡中推荐哈佛 CS249r《Machine Learning Systems Vol II》新书的 Performance Engineering(性能工程)章节,称其作为教材相当扎实:涵盖图编译、算子融合、精度、CUDA streams 剖析,还包含案例研究与常见坑。

作者此前的 Day 251 打卡也分享了 Aleksa(Gordic?)博客中的精选图解:逐行注释的 PTX 与 SASS 对应朴素矩阵乘 kernel、生产者/消费者 TMA(Tensor Memory Accelerator)流水线示例、thread block clusters 减少 L2 流量等,适合 GPU 编程学习者系统阅读。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →