双 RX 7900 XT 跑 Qwen 27B 实测:单流最高 66.5 TPS,离网传 100+ 差多远
EqualCryptographer67 · reddit · 2026-10-06
Reddit 用户在 2×RX 7900 XT(各 20GB)+ 128GB DDR4 平台上系统测试 Qwen 27B 与 Flash Next 的本地推理速度,详细记录了配置与结果:
- Qwen3.8-27B IQ4XS(ROCm + MTP3):生成 46.4 TPS;换 IQ2XXS 量化后达 66.5 TPS
- Flash Next UD-IQ4XS(约 93.7GB):单卡 ROCm 仅 8.6 TPS,双卡 Vulkan tensor split 1:1 反而只有 5.5–6.5 TPS
- 两个 IQ4 副本并行跑 16 并发可达 103.5 TPS 合计吞吐,但单条响应始终到不了 100 TPS
- 踩坑记录:跨双卡 tensor split 输出乱码,--no-mmap 可修复;PowerColor 卡接在 PCIe 3.0 x1 上可能是瓶颈
作者困惑于网传 16GB 显存就能 100+ TPS 的说法,质疑对方报的是单响应还是并发合计吞吐,并征求 CPU/RAM offload、x1 通道、后端设置方面的排查建议。测试细节:8k 上下文、f16 KV、thinking off,Flash Next 配置 256k 窗口但基本空跑。
「Infra」频道最新
- Reddit 求实测:128GB M5 Max Mac Studio 能扛住多智能体本地推理吗 — Simple_Telephone_867 · 2026-10-06
- 网友算账:大模型订阅价被补贴,MiniMax 推理毛利高达七八成 — menhguin · 2026-10-06
- 前沿实验室约 90% 算力已投向后训练与推理 — IanAndrewsDC · 2026-10-06
- KLIF 开源:一个窗口统一管理 llama.cpp、vLLM 等本地推理服务器 — Koksny · 2026-10-06
- 开发者晒 3 万亿 token 用量:9 月烧掉 842B,API 牌价 40.9 万美元订阅仅付 3.4% — doodlestein · 2026-10-06
- 一个 Dot 每天烧 16 亿 token:100 美元订阅跑出月均 54 万美元 API 等价成本 — DarthSilent · 2026-10-06