12GB 显存跑 Qwen3.8 量化版:解码 20-30 tok/s,131k 上下文

bodhi371 · reddit · 2026-10-09

作者分享在 12GB VRAM + 32GB 内存 + NVMe SSD 上运行 Qwen3.8-Flash-Next-GSQ-RCO-Abliterated(IQ3S 量化)的实测:解码 20-30 tok/s(Q2 量化可达 39-45 tok/s),131k 上下文下 prefill 达 300 至约 9 万 tok/s。

所用为 Strata 的自定义 fork,包含大量实验性架构改动(可能不稳定),整体硬件成本不到 2000(美元/元原帖未明示)。作者称某些方面"有本地 Opus 的感觉"。附 GitHub 配方与 fork 仓库链接。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →