7B 模型仅占 14GB:万字拆解 GPU 显存层级与推理带宽真相

techNmak · x · 2026-09-14

作者通过算例说明「模型放进显存」与「推理速度」是两回事:7B 模型 2 字节权重约 14GB,放进 80GB HBM 的 H100 绰绰有余,但即使按 3.35TB/s 全部带宽流式读取权重,单个 decode 步也要约 4.18ms,上限约 239 tokens/s——这还只是理论 sanity check。

核心要点:

作者已把这些笔记整理成一份 GPU 内存层级手册,覆盖寄存器、shared memory、L1/L2、HBM、局部性、coalescing、tiling、GEMM、attention、prefill vs decode 等。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →