GPU 像千人工厂:逐 token 生成可能 1 人与 100 人利用率相同
abhijithneil · x · 2026-09-04
开发者 abhijithneil 用比喻解释 GPU 推理的底层账:GPU 是有数千工位的工厂,单用户逐 token 生成相当于只派一个宽度的活。若把全部权重载入显存,每 token 需搬运 2N GB(N 为十亿级参数量、每参数 2 字节),用显存带宽除以这个数就能在写代码前算出吞吐上限——这意味着 1 个用户和 100 个用户同时请求时 GPU 利用率可能相同,瓶颈在带宽而非算力。
「Infra」频道最新
- AMD 发布 Threadripper Halo Station:96 核 CPU 配 576GB HBM3E — ccerrato147 · 2026-09-04
- 流体基础模型 AeroJEPA 正式加入 NVIDIA PhysicsNeMo 生态 — ricardovinuesa · 2026-09-04
- 2-2.5千欧预算搭建本地 AI 工作站:律师隐私 RAG 与 agentic coding 选型 — whatyathinkk · 2026-09-04
- 双卡 3090 够用吗?本地 LLM 玩家讨论是否再堆两张 — Blues520 · 2026-09-04
- NousResearch 携手 NVIDIA:Hermes Agent 实现一键本地部署 — lifebypixels · 2026-09-04
- 受监管行业求购 AI Gateway:Okta 集成加运行时策略执行 — IrrepressibleInk · 2026-09-04