ExLlamaV3 3 比特量化实测:单张 5090 跑 Flash 效果惊人

本地 LLM 玩家实测 ExLlamaV3/exl3 的 3bpw 量化方案:单张 RTX 5090 运行 Flash 模型可达约 1500 prefill 速度与 29 tps,效果惊人,发帖者准备弃用 vllm/llama.cpp。另有用户在 3x RTX 3090(250-265W,含一块 TB4 eGPU)上跑 Qwen 3.8 Next Flash,称 3 比特量化体验堪比 Q8。

2026-09-20 ~ 2026-09-21 · 2 条相关