RTX 5070 单卡实测 Qwen3.8 极致量化:12GB 显存跑出 22t/s
jacek2023 · reddit · 2026-08-29
用户分享了在 RTX 5070 (12GB VRAM) 上运行 Qwen3.8-Flash-Next 模型的 IQ1S 极致量化版本的经验。
配置与命令
- 模型:Qwen3.8-Flash-Next-UD-IQ1S (GGUF 格式)
- 硬件:单卡 RTX 5070
- 命令参数:设置并行数为 1 (--parallel 1),上下文长度 10000 (-c 10000)
性能数据
- 生成速度:约 21-22 tokens/s
- 提示处理:约 25 tokens/s
- 显存占用:成功压入 12GB 显存
用户建议低显存用户优先尝试小量化版本以验证兼容性。
「Infra」频道最新
- Mac Studio M5 Ultra 本地运行 320B 模型仅需两万美分之一成本 — SumitGup · 2026-08-29
- 模型太强也是灾难:Google TPU 起源于语音识别推理算力瓶颈 — demian_ai · 2026-08-29
- 16GB 显卡本地部署视频生成模型技巧 — mxjxn · 2026-08-29
- 腾讯将 Hy4-preview 从 1.5TB 压缩至 200GB GGUF — RedditUsr2 · 2026-08-29
- 16GB 显卡本地部署视频生成模型技巧 — PurzBeats · 2026-08-29
- Exo Labs 宣称 Mac Studio 集群内存带宽可达 4.8TB/s 且线性扩展 — anonmt57 · 2026-08-29