LLM 推理时显存都去哪了?四大占用逐项拆解
blaizedsouza · x · 2026-09-18
akshaypachaar 图文科普 LLM 推理期间 GPU 显存的四个去向:模型权重加载只是第一步,推理开始后显存会分给多个组件,其中部分会随上下文长度、batch 大小和并发数持续增长。
四个要点:
- 模型权重:加载后占用基本固定,最大优化杠杆是精度——从 FP16/BF16 降到 INT8 或 INT4 可按比例减少每参数字节数。
- KV cache:为避免重算注意力,每个历史 token 都要存 key/value 张量,随生成继续、上下文变长和并发请求增多而持续膨胀。
- 另两类占用(activations/工作区等)随运行状态变化。
作者同时引用了自己的长文《How a GPU Actually Works》,目标是让量化、投机解码、continuous batching 等技巧不再像一串玄学名词。
「Infra」频道最新
- 第三方复现 Gensyn open-1b 训练步,哈希链上可验证 — benfielding · 2026-09-18
- Anthropic 开源 Claude 撰写的 GPU 优化,30+ 生信模型平均提速 4 倍 — ResultBackground2450 · 2026-09-18
- Spotify 7.77 亿月活、每秒千万级请求,谈 AI 如何改变其工程质量体系 — rseroter · 2026-09-18
- Anthropic 开源 36 套生物 ML 工具推理优化套件,配套蛋白设计大赛 — AnthropicAI · 2026-09-18
- 单日新增 605 个 Linux 内核 CVE,前一日还有 276 个 — jedisct1 · 2026-09-18
- DeepSeek V4.1 Flash 上线 Inco,532 tokens/s 居速度榜第一 — songhan_mit · 2026-09-18