12GB 显存跑 Qwen3.8 Flash:3bpw 量化达成 15 tokens/s
KnownAd4832 · reddit · 2026-09-17
Reddit 用户在 12GB 显存(RTX 5070 SFF)+64GB DDR5 的机器上,以 3bpw 量化(IQ3XXS,称其在 AIME25 上匹敌 BF16)本地运行 Qwen3.8-Flash-Next-GSQ-RCO-GGUF,获得稳定 15 tokens/s 生成与约 100-120 tokens/s 的 prompt 处理速度。完整 GGUF 约 76GB,仅需 47GB 分片进显存+内存,其余由 SSD 承担。
实测数据:服务启动 4.9s;冷启动到 1K prompt 31.7s;1K 生成 13.8 tok/s;8K 生成 14.6 tok/s;20K prompt 处理 104.7 tok/s(输出前等待 3.11 分钟);20K 生成 14.0 tok/s;90-100K 生成 11.3 tok/s;最高验证到 128K 上下文。作者称输出质量在测试中达到 Unsloth Q6-Q8 水平,使用 FreeToken CLI + llama,并将测试 2.40bpw(对标 NVFP4/Q4)版本。
「Infra」频道最新
- 光通信商 Ciena 发布三年目标:年营收增约 30%,成低调 AI 受益股 — kevinsxu · 2026-09-17
- 算力若供不应求,分布式通用计算或迎来翻盘时刻 — gajesh · 2026-09-17
- 128GB 统一内存 Strix Halo 跑本地模型:实测 Qwen 27B-35B 最好用 — lebbi · 2026-09-17
- Alchemy IaC 工具发布面向 Coding Agent 的官方提示词 — samgoodwin89 · 2026-09-17
- Ayar Labs 光互连方案亮相 GPU 托盘,图看算力集群新形态 — BenBajarin · 2026-09-17
- 曝苹果自研 M8 Ultra 企业级 AI 服务器,最快 2029 年推出 — The Decoder · 2026-09-17