大内存+入门 GPU 跑 Qwen3-Next:Strata 混合推理达 45-50 tok/s

EmPips · reddit · 2026-10-03

一位 Reddit 用户分享了大内存低配机器本地跑大模型的实测:用 Strata 方案加载 Qwen3-Next 的 IQ3XXS 量化权重(约 80GB 以下),在慢速 DDR4 内存 + RX 7900XTX 的组合上稳定跑到约 45-50 tok/s,而同一台机器上调优后的 llama.cpp 只能到约 22.5 tok/s。

要点:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →