自研 Gem16 引擎:5080 笔记本 16GB 跑 Gemma4 26B,182 tok/s

Danmoreng · reddit · 2026-09-28

开发者 Danmoreng 受 Ninfer 启发,为 Blackwell 16GB GPU 写了一个小型推理引擎 Gem16,主体由 Codex 生成代码,花了多个周末调到比 vLLM 更快——因为 vLLM 在 16GB 显存下无法配合 MTP。引擎支持 Linux 和 Windows,自带原生 GUI,主要面向单用户(12B 可服务 2 个会话)。

性能:

已知问题: 12B 的原生音频理解在约 8k 上下文后模型不再识别音频 token,似为模型本身问题,社区已有人报告。开源在 GitHub,征求反馈。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →