四张 R9700 跑 vLLM-Radiance:prefill 达 17.6k tok/s
im_EDEN · reddit · 2026-09-03
Reddit 用户分享 AMD Radeon AI Pro R9700 四卡本地部署实测:官方 vLLM 仓库在四卡 R9700 上极慢,换用 vLLM-Radiance 分支后大幅改善——prefill 达 17,636 tok/s,decode 36.6 tok/s;配合 80% MTP 接受率最好跑出 106 tok/s。配置为 Gigabyte MZ32-AR0 主板 + EPYC 7282,运行 Qwen 3.8 27B fp8、262k 上下文;其中一张卡仅 PCIe 4x8,其余三张 4x16。值得注意的是 nvtop 显示四卡 100% 利用率,而官方仅支持双卡——四卡 setup 实测可用。
「Infra」频道最新
- 双 DGX Spark 实测:GLM-5.3-Flash 写作与视觉胜过 DeepSeek-V4-Flash — kuhunaxeyive · 2026-09-03
- Jeff Dean 2007 年幻灯片流出:数据中心硬件故障实录 — SumitGup · 2026-09-03
- 谷歌 Hot Chips 发布第八代 TPU:一年两款芯片,推理训练分开设计 — firstadopter · 2026-09-03
- 数据中心耗水是迷思?现代机房多用闭路冷却,用水仅如写字楼 — GlenBradley · 2026-09-03
- 推理工程吃香:vLLM/SGLang 搭副本加缓存路由核心配方 — GabGarrett · 2026-09-03
- Databricks 在 VLDB 2026 主推 agent 原生数据基础设施 Lakebase — matei_zaharia · 2026-09-03