2800 美元 8 卡 V620 攒 256GB 显存:自改 vLLM 跑 Qwen3.8 达 3000+ t/s 预填充
_TheWolfOfWalmart_ · reddit · 2026-10-09
一位 Reddit 用户用 8 张二手 Radeon Pro V620(RDNA2 云游戏卡,单卡 32GB,合计 256GB 显存)搭建了约 2800 美元的本地大显存推理平台:
- llama.cpp 在这套卡上预填充仅 350-450 t/s 且并发差,vLLM 则根本不支持。
- 他让 Claude 迭代编写适配 RDNA2 的自定义 vLLM 内核并自行构建测试,最终让 vLLM 跑通:Qwen3.8-Flash-Next 解码 60-100 t/s,预填充 3000+ t/s,比原来快约 800%。
- 配置细节:PP=4(无张量并行),专家路由 W4A16、其余 BF16,开启 MTP 3 token 草稿。计划继续优化并适配 DeepSeek 和 GLM-5.3-Flash。
「编程与Agent」频道最新
- 开发者为 UE5 开源 tokenizer 与 HuggingFace ONNX 管线插件 — NoahPersaud · 2026-10-09
- Devin 推出 Security Swarm:并行 agent 集群挖漏洞并直接交修复 PR — DevinAI · 2026-10-09
- LangChain 播客开聊 Decision Models:OpenAI 与 Databricks 已入场 — LangChain · 2026-10-09
- ClickUp Brain² 基于 E2B 微虚拟机构建企业级 agent 执行层 — badphilosopher · 2026-10-09
- Exa 发布 ATLAS 基准:最贵搜索 agent 仍漏掉约 1/3 关键结果 — yoimnotkesku · 2026-10-09
- 开源项目 rea 获 2.1 万星:用 Agent 逆向任意应用与二进制 — MatthewBerman · 2026-10-09