Gemma 4 26B 在单张 RTX 4090 上跑到 24 并发
DynamicWebPaige · x · 2026-08-04
这条转发给出了一组很具体的本地推理实测:在单张 RTX 4090(24GB VRAM)上,用 llama.cpp 跑 Gemma 4 26B A4B MoE,通过 8-bit KV cache 量化把并发从 14 个用户提升到 24 个。\n\n- 号称解码速度超过 500 tokens/s\n- 配置是 24 个 slot、每个 4096 上下文\n- 关键手段是 -ctk q80 -ctv q80,把 KV cache 从 16 bit 压到 8 bit\n- 作者宣称这带来 71% 的服务容量提升,且没有掉线
「Infra」频道最新
- Wan 2.1 可在三星手机本地运行,Quartz 支持图像视频生成 — SaientAI · 2026-08-04
- NVIDIA 推出零售版代理电商方案,强调商家控制结账与定价 — nvidia · 2026-08-04
- Stripe Projects 让 AI 代理从命令行开通主机鉴权数据库 — jeff_weinstein · 2026-08-04
- 多智能体工作流会烧掉海量 token,关键是控制重复成本 — HaktanSuren · 2026-08-04
- Next.js 16.3 内存降 90%,还加入智能体专用文档 — cramforce · 2026-08-04
- TokTier 用有状态分词加速智能体服务并保持精确一致 — omarsar0 · 2026-08-04