4 张 AMD R9700 搭 128GB 显存,十人初创本地推理实测数据出炉
sayamss · reddit · 2026-10-11
一位开发者分享为客户搭建的本地推理服务器:Threadripper 9970x + 128GB DDR5 ECC,配 4 张 AMD Radeon AI Pro R9700(共 128GB 显存),GPU 降压至 210W 以内,用 1600W 电源即可驱动。推理引擎用 Radiance 的 fork,服务 Qwen 3.8 Next flash/27b 与 DSV4 Flash。
实测结果:
- 16 个并发会话下,Qwen 3.8 27b MXFP4 聚合 prefill 达 6.3-6.8k tok/s,聚合 decode 900 t/s(4k-128k 上下文范围内 80-900 t/s)
- Qwen 3.8 Next flash:128k 上下文/用户时聚合 365 tok/s,48k 时达 538.5 tok/s
- KV cache 全程用 BF16
对想摆脱云 API、给小团队自建推理的用户是一份有参考价值的配置与压测数据。
「Infra」频道最新
- 弗州动物收容所控诉:邻近数据中心噪音吓坏救援犬 — Polymarket · 2026-10-11
- 5090 跑 Qwen3.8-27B:vLLM NVFP4 可行,FP8 基本无望 — BitGreen1270 · 2026-10-11
- AI 扩散更像病毒传播?Reddit 长文质疑 7000 亿美元基建狂欢 — thepotatobake · 2026-10-11
- Recall 开源:纯本地语义搜索,i5 核显 0.17 秒搜 PDF 音视频 — somthing_tn · 2026-10-11
- 192GB 显存跑 426GB MXFP4 版 DeepSeek,多 agent 代码审查实测 — HankYeomans · 2026-10-11
- awesome-local-ai:按任务分类的本地 AI 工具清单,专为 agent 设计 — blaizedsouza · 2026-10-11