60 张图解从零写出 B200 注意力内核,逼近 SOTA 性能
magoghm · hn · 2026-09-02
一篇图文教程用 60 张图完整讲解如何在 NVIDIA B200 GPU 上从零实现注意力(Attention)内核并达到接近 SOTA 的性能。内容覆盖 B200 硬件特性(如 TMA、张量核心、共享内存层次)、Flash Attention 的分块计算思路、bank conflict 与 swizzle、warp 特化等关键细节,配合图示逐步推导每个优化步骤,是学习 GPU 内核工程与注意力优化的高质量材料。
「Infra」频道最新
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Jeff Dean 2007 年幻灯片流出:数据中心硬件故障实录 — SumitGup · 2026-09-03
- 谷歌 Hot Chips 发布第八代 TPU:一年两款芯片,推理训练分开设计 — firstadopter · 2026-09-03
- 数据中心耗水是迷思?现代机房多用闭路冷却,用水仅如写字楼 — GlenBradley · 2026-09-03
- 推理工程吃香:vLLM/SGLang 搭副本加缓存路由核心配方 — GabGarrett · 2026-09-03
- Databricks 在 VLDB 2026 主推 agent 原生数据基础设施 Lakebase — matei_zaharia · 2026-09-03