自托管 Qwen3.8-27B 实测:推理跑出 200+ tokens/秒

gnukeith · x · 2026-08-15

开发者 @gnukeith 持续扩充自托管服务栈,当前包括:Vaultwarden(密码管理)、SGLang(推理引擎)、Qwen3.8-27B NVFP4 量化模型、Open WebUI、Forgejo、FUTO Notes Sync 和 Immich(照片管理)。

其中亮点是 SGLang 加载 Qwen3.8-27B NVFP4 后,本地推理速度约 200+ tokens/秒,体验相当流畅。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →