Windows 上跑 vLLM 完整指南:Docker+RTX PRO 6000 部署 Qwen3.8-27B
Demonicated · reddit · 2026-08-19
Windows 用户此前想跑 vLLM 大多只能退回 LM Studio 等简化方案,作者在 RTX PRO 6000 Blackwell(96GB)上摸索出一套完整流程,让 AI 帮忙整理成指南。这套方案用 Windows 11 + WSL 2 + Docker Desktop,将 Qwen3.8-27B 以 OpenAI 兼容服务形式跑起来,支持视觉、推理、工具调用、prefix caching 和 MTP 投机解码,且可并发跑多个 agent 交互而几乎不影响吞吐。
关键坑点:
- 跨 WSL 9P 边界读 Windows bind mount 会让 safetensors 加载极慢,应把模型一次性拷进 Docker named volume,缓存同理,后续启动大幅提速
- 固定 vLLM 0.26.0 镜像 tag,避免 Docker 静默复用过期的 latest 缓存
- 模型 18 个 checkpoint 分片全部下载完再启动;给出 131K 上下文的推荐基线参数(--max-num-seqs 2、--gpu-memory-utilization 0.92、chunked prefill、Qwen3 推理解析器等)
- PowerShell 变量在同一会话中复用,hf CLI 下载模型
「Infra」频道最新
- DSCO Router 推出多模型统一网关,支持自带账号自动路由 — arthurcolle · 2026-08-24
- 开源方案 RobotSoul:为 Agent 提供上下文重置后的持久身份 — robauto-dot-ai · 2026-08-24
- 将 MoE 模型卸载至 RAM 运行会遭遇极慢的 Prefill — former_farmer · 2026-08-24
- Etched获10亿美元融资,Jane Street领投验证专用芯片 — TheTuringPost · 2026-08-24
- ConvRot 量化方法入驻 llama-cpp,Q6 接近 Q8 精度 — giveen · 2026-08-24
- LifeOS:基于本地模型的语音驱动个人管理工具 — Extension-Bid-639 · 2026-08-24