网友拟开放 Qwen 3.8 27B 本地服务,每秒 56 Token
No_Run8812 · reddit · 2026-08-18
作者计划将本地的 Qwen 3.8 27B(8-bit 量化)免费开放给社区测试。环境配置为单张 RTX PRO 6000 96GB,通过 vLLM 部署。当前在 3 个并发用户、262K 上下文下,解码速度约 56 tk/s。作者在征求关于上下文长度限制(25 万 vs 缩短以支持更多用户)及访问方式(OpenAI 兼容 API vs WebUI)的建议。
「Infra」频道最新
- AI Token 需求三波浪潮:Physical AI 同时拉动云端与硬件 — FinanceYF5 · 2026-08-18
- 观点:transformer 终将被替换,英伟达能否「自己革自己的命」 — yangyi · 2026-08-18
- 文件系统成为 AI 时代数据交互的核心范式 — blaizedsouza · 2026-08-18
- Merge 与 Mastra 合作,为 AI Agent 提供统一 API 网关 — shensi · 2026-08-18
- MoE 模型高并发时会退化为加载全部权重吗? — LocalLLaMa_reader · 2026-08-18
- 实测 Qwen3.8-27B 跑满 16G 显存:256k 上下文详解 — ndiphilone · 2026-08-18