GPU 像千人工厂:逐 token 生成可能 1 人与 100 人利用率相同

abhijithneil · x · 2026-09-04

开发者 abhijithneil 用比喻解释 GPU 推理的底层账:GPU 是有数千工位的工厂,单用户逐 token 生成相当于只派一个宽度的活。若把全部权重载入显存,每 token 需搬运 2N GB(N 为十亿级参数量、每参数 2 字节),用显存带宽除以这个数就能在写代码前算出吞吐上限——这意味着 1 个用户和 100 个用户同时请求时 GPU 利用率可能相同,瓶颈在带宽而非算力。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →