ExLlamaV3 3 比特量化实测:单张 5090 跑 Flash 效果惊人
本地 LLM 玩家实测 ExLlamaV3/exl3 的 3bpw 量化方案:单张 RTX 5090 运行 Flash 模型可达约 1500 prefill 速度与 29 tps,效果惊人,发帖者准备弃用 vllm/llama.cpp。另有用户在 3x RTX 3090(250-265W,含一块 TB4 eGPU)上跑 Qwen 3.8 Next Flash,称 3 比特量化体验堪比 Q8。
2026-09-20 ~ 2026-09-21 · 2 条相关
- 3x 3090 本地跑 Qwen 3.8 Next Flash:3 比特量化体验堪比 Q8 — nicholas_the_furious · 2026-09-20
- 实测 exllamav3 3bpw 跑 Flash:单张 5090 达 1500 prefill/29 tps — youcloudsofdoom · 2026-09-21