双 3090 跑 Qwen3.8-Flash-Next:专家下放内存,51B n-gram 表落 NVMe

jbro1985 · reddit · 2026-08-29

Reddit 用户分享在 2×RTX 3090 + 96GB DDR5 上部署 Qwen3.8-Flash-Next(125B MoE + 51B n-gram 表)的完整实测:专家权重下放内存、n-gram 表经 mmap 放 NVMe。

Llama.cpp

vLLM

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →