GPU 利用率 100% 也会骗人:一份 42 页手册讲透 SM 与显存性能真相
techNmak · x · 2026-09-13
作者在撰写一份 42 页 GPU 性能手册时发现,多数人把三件事混为一谈:kernel 启动的工作量、实际驻留在 GPU 上的 warp、以及当前真正可发射指令的 warp——它们并不相同。
核心要点:
- 一个 240 blocks × 256 threads 的 kernel 有 61,440 个逻辑线程(1,920 个 warp),但受寄存器、shared memory、线程/块上限约束,并非全部同时驻留在 SM 上;驻留的 warp 还可能因访存、数据依赖或同步而等待。
- Occupancy ≠ GPU 利用率:前者是驻留 warp 与架构上限之比;NVML 的利用率只是采样窗口内至少一个 kernel 在执行的时间占比。
- 因此 GPU 显示 100% 利用率时,Tensor Core 和 HBM 带宽可能都远未饱和,瓶颈可能只卡在某个子系统。
- 显存层级(寄存器/shared memory/L1/L2/HBM)不是简单的快慢分级,作用域、容量、管理方式都不同;模型装进 HBM 不代表访存高效。FlashAttention 就是靠重排执行调度减少 HBM 与片上存储间流量的范例。
- Tensor Core 只负责矩阵乘累加,reduction、索引、elementwise、同步、数据搬运仍走 GPU 其他部分。
作者最终的结论是:别问「GPU 为什么不到 100%」,要问「现在真正限制有效进展的是什么」。
所属事件:42页GPU性能手册厘清利用率与占用率三大误区(2 条相关)→
「Infra」频道最新
- 深度长文拆解光纤-芯片耦合:单点指标好看不等于好产品 — jwt0625 · 2026-09-13
- 五角大楼拟向 Fluidstack 提供 50 亿美元 AI 基建贷款 — VraserX · 2026-09-13
- vLLM-Omni实测MiniMax H3:八卡B300生成10秒MP4仅耗时8.7秒 — 机器之心 · 2026-09-13
- AMD 反超高通,跻身全球第三大无晶圆厂芯片公司 — xiaosun86 · 2026-09-13
- 一个月冒出 5 个专用推理引擎,vLLM 核心成员驳「碎片化」质疑 — AccBalanced · 2026-09-13
- 二十年算力老兵驳 Dario「给前沿踩刹车」:算力不会闲置,只会改道 — basedjensen · 2026-09-13