哈佛 CS249r 新书性能工程章节:覆盖图编译、融合与 CUDA 流剖析
blaizedsouza · x · 2026-09-14
一位 GPU 编程学习者在「Day 252/365」打卡中推荐哈佛 CS249r《Machine Learning Systems Vol II》新书的 Performance Engineering(性能工程)章节,称其作为教材相当扎实:涵盖图编译、算子融合、精度、CUDA streams 剖析,还包含案例研究与常见坑。
作者此前的 Day 251 打卡也分享了 Aleksa(Gordic?)博客中的精选图解:逐行注释的 PTX 与 SASS 对应朴素矩阵乘 kernel、生产者/消费者 TMA(Tensor Memory Accelerator)流水线示例、thread block clusters 减少 L2 流量等,适合 GPU 编程学习者系统阅读。
「Infra」频道最新
- 美国第二大律所自购英伟达服务器,本地微调开源权重模型 — ai · 2026-09-14
- Andrew Chen 晒本地 AI 工作站:5090 eGPU 加双 DGX Spark 混合路由 — andrewchen · 2026-09-14
- 美国第二大律所拟花数亿美元自建 AI,微调开源 Nemotron 模型 — ivan_bezdomny · 2026-09-14
- Palantir 指定 Nebius 为首选主权 AI 基建伙伴 — pdamodaran · 2026-09-14
- INT21 SwarmOS:上万智能体协同进化优化推理引擎 — bingxu_ · 2026-09-14
- 回顾 2003 年:故障路由器曾淹没威斯康星大学 NTP 时间服务器 — walrus01 · 2026-09-14