vLLM 在 AMD v620 显卡上运行 Qwen 的配置求助
Thin_Pollution8843 · reddit · 2026-08-15
一位用户在尝试使用 vLLM 在 AMD v620 显卡上运行 Qwen3.6-35B-int8 模型时遇到了性能瓶颈,目前只能达到 1.3–1.5 tok/s,且调试多日未果。帖子寻求社区分享可行的配置方案或优化建议。
「Infra」频道最新
- 企业 AI 采购推动联想利润率创纪录,服务利润率达 PC 三倍 — shashib · 2026-08-16
- 分析师称谷歌 TPU 逐代直采更多台积电晶圆,IP 伙伴利润承压 — BenBajarin · 2026-08-16
- Baseten 首日支持 Qwen3.8-27B 微调 — baseten · 2026-08-16
- llama.cpp 集成 Moonshot Kimi-K3 文本模型 — pmttyji · 2026-08-15
- 自托管 Qwen3.8-27B 实测:推理跑出 200+ tokens/秒 — gnukeith · 2026-08-15
- AMD内部硅光子团队与Ayar Labs合作,进展或超联发科 — zephyr_z9 · 2026-08-15