AI 性能工程资源清单 v2 发布:从单次推理到 MoE serving 全覆盖

AccBalanced · x · 2026-08-24

waferai 发布了其 GPU 与 AI 性能工程学习资源清单的 v2 大更新,号称目前最全面的该领域学习资源。

清单采用「有立场」的编排:从单个推理请求的工作原理讲起,依次覆盖 CUDA 执行模型、roofline 分析、Transformer 算术、TTFT/TPOT/goodput 等服务指标,再到 kernel 优化。新增内容包括:FlashAttention-4、Blackwell tensor memory 与低精度 tensor core;continuous batching、KV-cache 系统、量化、投机解码与结构化解码;MoE serving、collectives、拓扑与 prefill/decode 分离;以及 Blackwell Ultra、MI350/CDNA4、Ironwood、Trainium3 等新硬件,和 Kernelbench-verified、SOL-execbench 等 benchmark。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →