实测:2×R9700 跑 Qwen 3.8 Flash Next 反超 3 卡配置,35 t/s
MarcusAurelius68 · reddit · 2026-09-05
作者在自己 X570 平台(Ryzen 9 5900XT、64GB DDR4、Windows 11)上对比了 2 卡与 3 卡 AMD R9700(32GB)运行 Qwen 3.8 Flash Next 的本地推理表现,结论是 2 卡反而更快。
关键发现:
- 3 卡配置下第三张卡走芯片组的 x4 慢速通道,拖累了整体性能;
- 用 2×R9700 跑 AD-4.27bpw Q4KM 量化版(33 个分片 GGUF,131k 上下文),经参数优化(尚未启用 MTP)后达到 prompt 处理 242 t/s、生成 35 t/s,整体优于 3 卡方案;
- 帖中给出完整 llama-cli 启动命令,包括 --fa on、q80 KV cache 量化、--jinja、采样参数等细节。
对想在消费级硬件上本地跑大上下文模型的人,这是一份可直接照抄的配置参考。
「Infra」频道最新
- GPU推理价值无统一度量标准,算力期货正赌在这些指数上 — AccBalanced · 2026-09-05
- Hermes 上线本地后端:支持 DeepSeek-V4-Flash 等模型 UD-Q4 量化 — maximelabonne · 2026-09-05
- AI Now 播客谈数据中心狂飙:社区反对声与「他们不建在自己家」 — AINowInstitute · 2026-09-05
- Apple Silicon 推理优化挑战:Gemma 4 Mac 跑速提升 151.4% — gajesh · 2026-09-05
- SGLang 开源 Breakable CUDA Graph:Prefill 建图提速 3.8–5.2 倍 — ying11231 · 2026-09-05
- SemiAnalysis:OpenAI 自研 ASIC 意在吓退 NVIDIA,输赢都赚 — MarvinTBaumann · 2026-09-05