12GB 显存跑 Qwen3.8 Flash:3bpw 量化达成 15 tokens/s

KnownAd4832 · reddit · 2026-09-17

Reddit 用户在 12GB 显存(RTX 5070 SFF)+64GB DDR5 的机器上,以 3bpw 量化(IQ3XXS,称其在 AIME25 上匹敌 BF16)本地运行 Qwen3.8-Flash-Next-GSQ-RCO-GGUF,获得稳定 15 tokens/s 生成与约 100-120 tokens/s 的 prompt 处理速度。完整 GGUF 约 76GB,仅需 47GB 分片进显存+内存,其余由 SSD 承担。

实测数据:服务启动 4.9s;冷启动到 1K prompt 31.7s;1K 生成 13.8 tok/s;8K 生成 14.6 tok/s;20K prompt 处理 104.7 tok/s(输出前等待 3.11 分钟);20K 生成 14.0 tok/s;90-100K 生成 11.3 tok/s;最高验证到 128K 上下文。作者称输出质量在测试中达到 Unsloth Q6-Q8 水平,使用 FreeToken CLI + llama,并将测试 2.40bpw(对标 NVFP4/Q4)版本。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →