单卡 3090 + 32GB 内存如何榨干本地模型显存

Certain_Yam_5824 · reddit · 2026-09-12

楼主分享自己的本地部署配置:单张 3090(24GB 显存)+ 32GB DDR4,运行 Qwen3.8-27B 的 q80 量化版,128k 上下文。为腾出显存放上下文,他不得不剥离模型的 mmproj 多模态部分。想要更大的模型跑夜间任务,但苦于找不到考虑上下文开销后能塞进约 48GB 的多模态模型,目前在需要长上下文时以 256k 窗口重跑 Qwen3.8。帖内有具体的显存取舍经验,评论区在讨论 48GB 规模的模型选择。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →