用 H100 算账:内存带宽才是大模型推理的真正瓶颈
ai · x · 2026-10-06
作者解释为何 AI 硬件的关注点正从 GPU 算力转向内存与芯片互连:核心在于数据能否贴近计算、多快能搬到位。
- 以 NVIDIA H100 SXM 为例:稠密 BF16 张量算力理论峰值约 989 TFLOPS,配 80 GB 显存、3.35 TB/s 带宽。
- Llama 3.1 70B 约 706 亿参数,BF16 下仅权重就占约 141 GB,一张 H100 装不下,至少需要多卡承载。
- 稠密模型每生成一个 token 都要几乎用到全部权重,运算量大致是每权重一次乘加。
- 由此形成结构性问题:算力远超所需,真正的瓶颈是海量权重数据在显存与计算单元之间的搬运,这正是 HBM、内存容量和互连技术备受关注的原因。
「Infra」频道最新
- AI 数据中心 2035 年或需 500GW,前英官员警告能源成最大瓶颈 — ShakeelHashim · 2026-10-06
- Starlink 在轨卫星超 1.1 万颗,占全球活跃卫星约三分之二 — XFreeze · 2026-10-06
- Ben Bajarin:Agentic AI 推动数据中心 CPU 需求,关键在 Scale-Up 域设计 — BenBajarin · 2026-10-06
- llama.cpp 作者:Qwen3.8-27B 用户可换 DFlash 投机解码再提速 — victormustar · 2026-10-06
- GLM 5.3 全量 NVFP4 可在 4 张 B200 或 H200 上部署 — TheZachMueller · 2026-10-06
- 网友把 GLM-5.3 无审查版量化成 MXFP4,AMD GPU 可跑 — bakatristan · 2026-10-06