自托管 Qwen3.8-27B 实测:推理跑出 200+ tokens/秒
gnukeith · x · 2026-08-15
开发者 @gnukeith 持续扩充自托管服务栈,当前包括:Vaultwarden(密码管理)、SGLang(推理引擎)、Qwen3.8-27B NVFP4 量化模型、Open WebUI、Forgejo、FUTO Notes Sync 和 Immich(照片管理)。
其中亮点是 SGLang 加载 Qwen3.8-27B NVFP4 后,本地推理速度约 200+ tokens/秒,体验相当流畅。
「Infra」频道最新
- Qwen3.8 27b 在 M5 Max 128GB 上跑分实测 — julianharris · 2026-08-16
- 模型推理的证明缺失:谁能证明跑的是哪个权重? — Some_parts_Bi · 2026-08-16
- WeeLLM:4GB 显存无损运行 FLUX.1 等大模型 — AlarmingPhrase8174 · 2026-08-16
- 企业 AI 采购推动联想利润率创纪录,服务利润率达 PC 三倍 — shashib · 2026-08-16
- 分析师称谷歌 TPU 逐代直采更多台积电晶圆,IP 伙伴利润承压 — BenBajarin · 2026-08-16
- Baseten 首日支持 Qwen3.8-27B 微调 — baseten · 2026-08-16