7B 模型仅占 14GB:万字拆解 GPU 显存层级与推理带宽真相
techNmak · x · 2026-09-14
作者通过算例说明「模型放进显存」与「推理速度」是两回事:7B 模型 2 字节权重约 14GB,放进 80GB HBM 的 H100 绰绰有余,但即使按 3.35TB/s 全部带宽流式读取权重,单个 decode 步也要约 4.18ms,上限约 239 tokens/s——这还只是理论 sanity check。
核心要点:
- 容量 ≠ 性能:真正问题是哪些字节在移动、从哪一层供给、多快移动、以及 kernel 是否有足够独立工作掩盖等待。装得进 HBM 仍可能受带宽限制;带宽再高也可能被依赖加载延迟卡住。
- 层级没那么整齐:CUDA 的内存空间命名不是物理位置——global memory 加载可能由 L1/L2 命中而不到 HBM;「local memory」虽然线程私有,物理上却放在设备内存里。
- 复用才是关键:从 HBM 取一次、在 shared memory/寄存器里复用几十次,和反复从远处取,同样的算术性能天差地别——高性能 GEMM 本质上是数据搬运调度。
- 访问几何也重要:同一 warp 加载 256 字节,stride 1/2/4 对应 256/512/1024 字节的请求足迹,载荷相同而开销不同。
- FlashAttention 是最佳例子:attention 函数不变,改变的只是中间 tile 放哪、留多久、要不要走不必要的 HBM 往返。
作者已把这些笔记整理成一份 GPU 内存层级手册,覆盖寄存器、shared memory、L1/L2、HBM、局部性、coalescing、tiling、GEMM、attention、prefill vs decode 等。
「Infra」频道最新
- SK 海力士完成 HBM4 内部认证,HBM 进入定制基底裸片竞争时代 — blaizedsouza · 2026-09-14
- 一个架构改动让 KV 缓存缩小 8 倍:GQA 原理与 Llama 3 实例拆解 — blaizedsouza · 2026-09-14
- HBM 系统架构全景:从 DDR 演化到 GDDR7、PIM 与 HBF 等替代路线 — blaizedsouza · 2026-09-14
- Nvidia 新论文:让 LLM 稀疏化提速,95% 静默神经元可被跳过 — YesThisIsLion · 2026-09-14
- 开源 Tahuna 基础设施,支撑自主 ML 实验循环 Hillclimb — Monaim101 · 2026-09-14
- 马斯克放话:每年送 1000 万吨入轨,太空建太瓦级算力 — elonmusk · 2026-09-14