自研 Gem16 引擎:5080 笔记本 16GB 跑 Gemma4 26B,182 tok/s
Danmoreng · reddit · 2026-09-28
开发者 Danmoreng 受 Ninfer 启发,为 Blackwell 16GB GPU 写了一个小型推理引擎 Gem16,主体由 Codex 生成代码,花了多个周末调到比 vLLM 更快——因为 vLLM 在 16GB 显存下无法配合 MTP。引擎支持 Linux 和 Windows,自带原生 GUI,主要面向单用户(12B 可服务 2 个会话)。
性能:
- Gemma4 12B(含音频+视觉):prefill 5,800 tok/s,解码 87 tok/s
- Gemma4 26B(含视觉,EXL3 类自研量化):prefill 5,660 tok/s,解码 182 tok/s,可容纳 220k 上下文
已知问题: 12B 的原生音频理解在约 8k 上下文后模型不再识别音频 token,似为模型本身问题,社区已有人报告。开源在 GitHub,征求反馈。
「Infra」频道最新
- 云南锗业财报:InP 原料铟本土供应紧张,放开管制也无货可出 — pstAsiatech · 2026-09-28
- Apple 端侧模型 fm 搭决策小模型 Jev,路由测试全对比 — jasonkneen · 2026-09-28
- 估算:粗略描述人体生物学需千亿亿字节,超全球存储千倍 — IgorCarron · 2026-09-28
- 6 张 RTX 6000 满血 325W 长期运行, GPU 温度仅 41°C — TheZachMueller · 2026-09-28
- RTX 3090 本地跑 MiniMax H3 视频生成:每步 6294 秒还翻车 — play150 · 2026-09-28
- 16GB 显卡跑 177B MoE:SSD 流式推理实测 9-10 tok/s — TypicalPudding6190 · 2026-09-28