RTX 6000 Pro 本地跑 Qwen3 8B Flash:预填 2000tps 但解码仅 40tps

AppealSame4367 · reddit · 2026-09-04

作者在租用的 RTX 6000 Pro 上用 ikllama 跑 Qwen3 8B Flash,配置为 3 个 slot、200k 上下文、IQ4 量化、Q8 KV cache:单请求预fill约 2000 tps,但解码仅 40 tps;2-4 路并行时预fill降至 500-1000 tps、解码跌到 10-20 tps。他认为这是除数据中心 GPU 外该模型能跑的最好单卡,但实际表现并不理想,尝试过 vLLM recipes 也无改善,发帖求更优的 2-4 并发、Q4+ 量化、Q8 KV cache 配置方案。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →