42 页 GPU 性能手册:厘清利用率、占用率与瓶颈的三个误区
techNmak · x · 2026-09-13
作者在编写 GPU 性能手册时发现,大多数人把三件不同的事混为一谈:kernel 启动的工作、实际驻留在 GPU 上的工作、以及当前可发射(ready to issue)的工作。
- 以 240 blocks × 256 threads 的 kernel 为例:共 61,440 逻辑线程、1,920 个 warp,但受寄存器、shared memory、线程/warp/block 限制,warp 并不会全部同时驻留;调度器只能从真正 eligible 的 warp 中选择。
- 占用率(occupancy)是驻留 warp 数与架构上限之比;GPU 利用率在 NVML 中只是采样窗口内有 kernel 执行的时间占比——所以 GPU 可以显示 100% 利用率,但 Tensor Cores 和 HBM 带宽都没跑满,瓶颈只在某个子系统。
- 内存层级(寄存器/共享内存/L1/L2/HBM)不只是越来越慢,它们的 scope、容量、管理与访问行为各不相同。模型放进 HBM 只说明放得下,不代表带宽、合并访问、复用不是瓶颈——FlashAttention 就是靠重排执行调度来减少 HBM 与片上存储之间的数据搬运。
- Tensor Cores 是专用矩阵乘加硬件,但归约、索引、逐元素运算、同步、内存搬运等大量指令仍走 GPU 其他部分。
作者由此把问题从「为什么 GPU 不到 100%」改成「现在到底什么在限制有效进展」,并写成一份 42 页手册,覆盖 SM、warp、调度器、latency hiding、coalescing、GEMM 映射、精度与易误读的性能指标。
所属事件:42页GPU性能手册厘清利用率与占用率三大误区(2 条相关)→
「Infra」频道最新
- AI Agent 耗电远超聊天机器人,正驱动数据中心大扩张 — nordicinst · 2026-09-13
- SmolVM 开源:给 AI Agent 一台毫秒级启动的安全持久虚拟机 — aniketmaurya · 2026-09-13
- 硬件短缺逼出极客文化:本地 LLM 社区迎来「互联网黄金年代」 — feelspeaceman · 2026-09-13
- Cloudera 携手 Mistral,把模型搬到 30 EB 企业私有数据旁 — shashib · 2026-09-13
- 匿名爆料称发现全新 scaling 轴线,中国硬件难以复制 — QuintinPope5 · 2026-09-13
- SpaceX 再签神秘 AI 算力客户,月入 11.1 亿美元 — mark_k · 2026-09-13