RTX 6000 Pro 本地跑 Qwen3 8B Flash:预填 2000tps 但解码仅 40tps
AppealSame4367 · reddit · 2026-09-04
作者在租用的 RTX 6000 Pro 上用 ikllama 跑 Qwen3 8B Flash,配置为 3 个 slot、200k 上下文、IQ4 量化、Q8 KV cache:单请求预fill约 2000 tps,但解码仅 40 tps;2-4 路并行时预fill降至 500-1000 tps、解码跌到 10-20 tps。他认为这是除数据中心 GPU 外该模型能跑的最好单卡,但实际表现并不理想,尝试过 vLLM recipes 也无改善,发帖求更优的 2-4 并发、Q4+ 量化、Q8 KV cache 配置方案。
「Infra」频道最新
- 摩根士丹利:中国科创板 20% IPO 主攻「卡脖子」技术 — pstAsiatech · 2026-09-04
- 曝 DeepSeek 拟在内蒙古部署 16 万颗华为昇腾 950DT,暂不用于训练 — kimmonismus · 2026-09-04
- 蔡司高管:中国在 EUV 光刻设备上落后约 15 年 — pstAsiatech · 2026-09-04
- 铭凡 MS-S1 MAX 495 欧洲预售价疑似 7999 欧元,价格翻倍引吐槽 — fairydreaming · 2026-09-04
- K2-Horizon-MoVA-36B MLX 4bit 本地推理实测:最高 49.1 tok/s — DerTomsn · 2026-09-04
- TSMC 高管:半年内设备采购预测翻近 1.9 倍,20 座晶圆厂在建 — firstadopter · 2026-09-04