4 张 AMD V620 跑 Qwen3.8-Flash,编码生成 70+ tok/s

Thin_Pollution8843 · reddit · 2026-09-17

Reddit 用户分享了在 4 张 RDNA2 架构的 AMD V620 GPU 上运行量化版 Qwen3.8-Flash-Next(Intel/Qwen3.8-Flash-Next-W4A16-AutoRound,质量损耗约在 Unsloth q5-xl 与 q6-xl 之间)的实测成绩,依托 vllm-rdna 社区项目实现对 RDNA2 的支持:

展示了用老旧数据中心 GPU 组建本地推理的性价比路线,也凸显社区驱动 vllm 适配的成果。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →