Gemma 4 31B 的 KV Cache 内存开销比 DeepSeek V4 Flash 高 13 倍
teortaxesTex · x · 2026-08-04
- 这条帖子用两张 KV cache size calculator 截图,对比了 Gemma 4 31B 和 DeepSeek V4 Flash 的上下文缓存开销。
- 文本里作者指出,Gemma 4 31B 在等 KV 精度下,活跃参数更多、每个上下文 token 的内存占用也更高;在 batch=32 / 256K 的条件下,KV cache 甚至会到 320GB。
- 配图中,Gemma 4 31B 在 100 万 token、FP8/INT8 设定下的总 cache 为 38.54 GiB;而 DeepSeek V4 Flash 在同样 token 量下仅约 2.89 GiB。
- 核心信息是:模型架构和注意力缓存设计会显著改变推理显存成本,这直接影响高并发长上下文部署。
「Infra」频道最新
- 中国 AI 芯片出货量或从 380 万升至 2028 年 1290 万 — teortaxesTex · 2026-08-04
- 长上下文语音 Agent 取消 turn detection,改用异步压缩切换 — juberti · 2026-08-04
- MiniMax H3 首日支持本地部署,最低只需两张 RTX 5090 — yvbbrjdr · 2026-08-04
- MiniMax H3 在 ComfyUI 实测:1280×704 要 14–15GB 显存和 1 小时以上 — ayakitodev · 2026-08-04
- Atomic 发布 14 个 DeepSeek V4 Flash 量化版,主推 128GB 机器 — testingcatalog · 2026-08-04
- 引用帖看多:未来两年 neoclouds 可能迎来一轮大涨潮 — abhiadesai · 2026-08-04