vLLM 在 AMD v620 显卡上运行 Qwen 的配置求助

Thin_Pollution8843 · reddit · 2026-08-15

一位用户在尝试使用 vLLM 在 AMD v620 显卡上运行 Qwen3.6-35B-int8 模型时遇到了性能瓶颈,目前只能达到 1.3–1.5 tok/s,且调试多日未果。帖子寻求社区分享可行的配置方案或优化建议。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →