4 张 AMD V620 跑 Qwen3.8-Flash,编码生成 70+ tok/s
Thin_Pollution8843 · reddit · 2026-09-17
Reddit 用户分享了在 4 张 RDNA2 架构的 AMD V620 GPU 上运行量化版 Qwen3.8-Flash-Next(Intel/Qwen3.8-Flash-Next-W4A16-AutoRound,质量损耗约在 Unsloth q5-xl 与 q6-xl 之间)的实测成绩,依托 vllm-rdna 社区项目实现对 RDNA2 的支持:
- Regular 场景:32K 上下文 prompt 处理 1393 tok/s、生成 57.9 tok/s;128K 下仍达 1313 / 56.1 tok/s
- Coding 场景:32K 下生成 70 tok/s;64K 最高 72.5 tok/s;128K 保持 68.3 tok/s
展示了用老旧数据中心 GPU 组建本地推理的性价比路线,也凸显社区驱动 vllm 适配的成果。
「Infra」频道最新
- Cloudflare 上线首个隐身模型 Union Alpha,并行调用多模型融合答案 — ritakozlov · 2026-09-17
- Qwen3.8-Flash-Next 实测:254K 长上下文首 token 提速 1.56 倍 — FantasticNature7590 · 2026-09-17
- 隐私 LLM 服务 Venice 日处理 token 量达 2500 亿,三月翻 2.5 倍 — 0xAllen_ · 2026-09-17
- Baseten 推出 Hosted Tools:开源模型首次获服务端实时联网搜索 — baseten · 2026-09-17
- 开发者提议 Claude Code 应做预测性动态上下文缓存 — Sauers_ · 2026-09-17
- Starlink 拉美农村联网大扩张:洪都拉斯万台天线连 8000 所学校 — NicoVerderosa · 2026-09-17