Windows 上跑 vLLM 完整指南:Docker+RTX PRO 6000 部署 Qwen3.8-27B

Demonicated · reddit · 2026-08-19

Windows 用户此前想跑 vLLM 大多只能退回 LM Studio 等简化方案,作者在 RTX PRO 6000 Blackwell(96GB)上摸索出一套完整流程,让 AI 帮忙整理成指南。这套方案用 Windows 11 + WSL 2 + Docker Desktop,将 Qwen3.8-27B 以 OpenAI 兼容服务形式跑起来,支持视觉、推理、工具调用、prefix caching 和 MTP 投机解码,且可并发跑多个 agent 交互而几乎不影响吞吐。

关键坑点:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →