Gewell:利用 Gemma 4 结构,KV 缓存省 37.5% 显存的推理引擎
stoppableDissolution · reddit · 2026-09-21
开发者自建推理引擎 Gewell,在 Blackwell 上高并发运行 Gemma 4 31B。核心洞察是利用 Gemma 特有的结构(全局注意力层 K/V 权重绑定、RoPE 仅旋转 25% 的 K),数学无损地把 KV 缓存显存降到 0.625 倍,而 vLLM/llama.cpp 都存完整 K 和 V。额外的反展开计算很快被更少的显存读取抵消,可容纳更多上下文与缓存前缀。
缓存策略是另一卖点:vLLM 的 LRU 会把间隔较长的重复 prompt 前缀挤出去,而 Gewell 面向 writer+critic 这类循环数据生成负载设计了更聪明的淘汰策略与显式 cache 提示,还能合并中间 checkpoint 保持多会话同时温热。启动速度也极快——GEMM 形状离线 profile 后硬编码,无 Python import 开销。实测 TTFT 在大 batch 下略慢于 vLLM,但目标负载下整体 t/s 更高。
「Infra」频道最新
- 双卡 R9700 本地推理踩坑:从 LGA1700 升级 Threadripper 的 PCIe 通道账 — El_90 · 2026-09-21
- Komlós 猜想被宣布解决,数学家点出其对神经网络量化的隐含意义 — stevenstrogatz · 2026-09-21
- 英伟达点名 5 家用 AI 做清洁能源的公司:电网评估从 45 天缩到 2 分钟 — nordicinst · 2026-09-21
- Mozilla 实测:本地 30B 模型零 API 全程自动开出真实 PR — mozilla-ai · 2026-09-21
- NVIDIA 盘点 5 家 AI 清洁能源公司:电网审核从 45 天缩到 2 分钟 — NVIDIA Blog · 2026-09-21
- Cohere Labs 推出 Local AI 社区计划,聚焦本地推理与硬件调优 — Cohere_Labs · 2026-09-21