双 R9700 64GB 本地跑 Qwen3.8:全套 4 千欧,解码 111 tok/s
smallDeltaBigEffect · reddit · 2026-09-07
Reddit 用户晒出 2× AMD Radeon AI PRO R9700(32GB×2)本地推理主机的完整配置与首日跑分,全套约 4000 欧,比单张 RTX 5090 还便宜 1000 多欧。
- 配置:Ryzen 7500F、64GB DDR5 6400、Asus ProArt X870E,双卡 PCIe 5.0 x8;唯一问题是其中一张卡偏热,计划限功率 210W 并降压
- Qwen3.8-27B(Quark AWQ MXFP4,vLLM Radiance TP2):单流解码中位数 111.4 tok/s,ITL 1% low 77.9 tok/s,TTFT 81ms,131k 上下文,预fill 2k 达 4224 tok/s
- FP8 原生权重:87.6 tok/s,16k 上下文,8 并发序列
- Qwen3.8-Flash-Next(UD-IQ4XS GGUF,R9V fork 分层专家卸载):35.4 tok/s;意外发现 SATA SSD 卸载表现并不差
- 用途:深度研究、摘要、图像生成与轻度编码;下一步测试上下文退化与 KV 量化
为 AMD 双卡+vLLM 的性价比本地部署提供了详实参考数据。
「Infra」频道最新
- RandKV 开源:把 Random Attention KV 缓存驱逐策略做成 pip 一键可用 — atease01 · 2026-09-07
- 为无网村庄置办本地 LLM:5 千美元预算选卡求建议 — Potential_Low_1183 · 2026-09-07
- 开发者自制 llama.cpp 分支,让 MoE 模型支持专家数量扩展 — Specific-Tax-6700 · 2026-09-07
- 靠 ChatGPT 补贴跑 bot 两天仅赚 $2.60,作者担心断供 — TheMoonMidas · 2026-09-07
- NeurIPS 教育赛道推出投机解码交互式教程,讲透何时无损 — Madisonkanna · 2026-09-07
- Dell COO:AI 需求超过供给,DRAM、NAND、CPU、磁盘全面短缺 — mattwbaker · 2026-09-07