AI 性能工程资源清单 v2 发布:从单次推理到 MoE serving 全覆盖
AccBalanced · x · 2026-08-24
waferai 发布了其 GPU 与 AI 性能工程学习资源清单的 v2 大更新,号称目前最全面的该领域学习资源。
清单采用「有立场」的编排:从单个推理请求的工作原理讲起,依次覆盖 CUDA 执行模型、roofline 分析、Transformer 算术、TTFT/TPOT/goodput 等服务指标,再到 kernel 优化。新增内容包括:FlashAttention-4、Blackwell tensor memory 与低精度 tensor core;continuous batching、KV-cache 系统、量化、投机解码与结构化解码;MoE serving、collectives、拓扑与 prefill/decode 分离;以及 Blackwell Ultra、MI350/CDNA4、Ironwood、Trainium3 等新硬件,和 Kernelbench-verified、SOL-execbench 等 benchmark。
「Infra」频道最新
- 美限制芯片出口或迫使中国彻底摆脱英伟达依赖 — VraserX · 2026-08-24
- xllm 实现 0.4 秒极速图像生成 — warycat · 2026-08-24
- WULF CEO 揭秘:数据中心闭环系统极省水 — robleclerc · 2026-08-24
- Cursor 团队推 Git 大规模架构,力挺无状态化存储 — thesephist · 2026-08-24
- 韩国半导体工程师地位超越医生,家长意愿成风向标 — SuB8u · 2026-08-24
- 本地开发高效且可控,何必一味依赖云端 — vboykis · 2026-08-24