Gemma 4 26B 在单张 RTX 4090 上跑到 24 并发

DynamicWebPaige · x · 2026-08-04

这条转发给出了一组很具体的本地推理实测:在单张 RTX 4090(24GB VRAM)上,用 llama.cpp 跑 Gemma 4 26B A4B MoE,通过 8-bit KV cache 量化把并发从 14 个用户提升到 24 个。\n\n- 号称解码速度超过 500 tokens/s\n- 配置是 24 个 slot、每个 4096 上下文\n- 关键手段是 -ctk q80 -ctv q80,把 KV cache 从 16 bit 压到 8 bit\n- 作者宣称这带来 71% 的服务容量提升,且没有掉线

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →