功率受限 5090 配 96GB 内存:Qwen3.8-Flash 本地跑出 200 tok/s
z0_o6 · reddit · 2026-10-02
Reddit 用户分享实测:在一块功率受限的 RTX 5090 加 96GB DDR5-6400 内存上,用 Strata(llama.cpp 系工具)运行 IQ3S 量化的 Qwen3.8-Flash-Next,128k 上下文(8-bit KV cache)下解码速度达到 150-200 tok/s,预填充 5-6k tok/s。说明即使显存受限、靠部分 offload 到内存,本地也能跑长上下文大模型且速度可用。
「Infra」频道最新
- DGX Spark 溢价至 6950 美元,博主称是最差的 GPU 投资 — Signalman23 · 2026-10-03
- Hugging Face 发布 State of Local AI 2026:单卡游戏 GPU 已达年初顶级水平 — Scobleizer · 2026-10-03
- 爆料称 DeepSeek V4.1 Pro 约 2T 参数,从零稀疏训练无不稳定 — teortaxesTex · 2026-10-03
- Stas Bekman 的集群评估 skill 补充 AWS 集群实测演示 — StasBekman · 2026-10-03
- 64GB 内存+16G 显存跑 180B Qwen3.8-Flash-Next,Strata 实测 40-50 t/s — danamir_ · 2026-10-03
- NVIDIA Spark 涨价 30% 至 7000 美元,本地 AI 玩家求助替代方案 — Apprehensive_Side219 · 2026-10-03