Gewell:利用 Gemma 4 结构,KV 缓存省 37.5% 显存的推理引擎

stoppableDissolution · reddit · 2026-09-21

开发者自建推理引擎 Gewell,在 Blackwell 上高并发运行 Gemma 4 31B。核心洞察是利用 Gemma 特有的结构(全局注意力层 K/V 权重绑定、RoPE 仅旋转 25% 的 K),数学无损地把 KV 缓存显存降到 0.625 倍,而 vLLM/llama.cpp 都存完整 K 和 V。额外的反展开计算很快被更少的显存读取抵消,可容纳更多上下文与缓存前缀。

缓存策略是另一卖点:vLLM 的 LRU 会把间隔较长的重复 prompt 前缀挤出去,而 Gewell 面向 writer+critic 这类循环数据生成负载设计了更聪明的淘汰策略与显式 cache 提示,还能合并中间 checkpoint 保持多会话同时温热。启动速度也极快——GEMM 形状离线 profile 后硬编码,无 Python import 开销。实测 TTFT 在大 batch 下略慢于 vLLM,但目标负载下整体 t/s 更高。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →