vLLM 部署 Qwen 3.8 27B 遭遇推理超时难题

germangrower69 · reddit · 2026-08-16

开发者在 RTX 6000 Pro 上使用 vLLM 部署 Qwen 3.8 27B 时遇到严重的性能瓶颈。无论将 thinking effort 设置为高、中还是低,模型都陷入了极长的推理过程(低设置下仍需 1-2 分钟),远超同硬件下 Qwen 3.6 或 DeepSeek V4 Flash 的 20-30 秒响应。作者尝试了多种量化、解析器配置及启动参数均未解决,正在寻求关于 chat template 或生成参数的解决方案。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →