双 7900XTX 跑 Qwen 3.8 仅 11 token/秒,网友求解性能之谜
Nota_ReAlperson · reddit · 2026-09-05
作者用两张 AMD 7900XTX 加 128GB DDR4 内存在最新 llama.cpp 上运行 Qwen 3.8 Next,仅得到约 11 token/秒的速度,远低于其他用户在单卡 3090 或 9700XT 上的表现,发帖求助性能排查建议。
「Infra」频道最新
- SGLang 开源 Breakable CUDA Graph:Prefill 建图提速 3.8–5.2 倍 — ying11231 · 2026-09-05
- SemiAnalysis:OpenAI 自研 ASIC 意在吓退 NVIDIA,输赢都赚 — MarvinTBaumann · 2026-09-05
- 分析师:2027 年是算力供给最紧之年,2028 年才现缓解 — BenBajarin · 2026-09-05
- 担心模型被下架,开发者自建 P2P 网络做开源权重模型的做种分发 — Relevant-Magic-Card · 2026-09-05
- NVIDIA 拆解投机解码:5 条准则平衡 LLM 推理吞吐与延迟 — NVIDIAAI · 2026-09-05
- Qdrant 1.19.1 发布:量化 HNSW 搜索提速最高 2.5 倍 — qdrant_engine · 2026-09-05