功率受限 5090 配 96GB 内存:Qwen3.8-Flash 本地跑出 200 tok/s

z0_o6 · reddit · 2026-10-02

Reddit 用户分享实测:在一块功率受限的 RTX 5090 加 96GB DDR5-6400 内存上,用 Strata(llama.cpp 系工具)运行 IQ3S 量化的 Qwen3.8-Flash-Next,128k 上下文(8-bit KV cache)下解码速度达到 150-200 tok/s,预填充 5-6k tok/s。说明即使显存受限、靠部分 offload 到内存,本地也能跑长上下文大模型且速度可用。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →