网友拟开放 Qwen 3.8 27B 本地服务,每秒 56 Token

No_Run8812 · reddit · 2026-08-18

作者计划将本地的 Qwen 3.8 27B(8-bit 量化)免费开放给社区测试。环境配置为单张 RTX PRO 6000 96GB,通过 vLLM 部署。当前在 3 个并发用户、262K 上下文下,解码速度约 56 tk/s。作者在征求关于上下文长度限制(25 万 vs 缩短以支持更多用户)及访问方式(OpenAI 兼容 API vs WebUI)的建议。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →