单卡 3090 + 32GB 内存如何榨干本地模型显存
Certain_Yam_5824 · reddit · 2026-09-12
楼主分享自己的本地部署配置:单张 3090(24GB 显存)+ 32GB DDR4,运行 Qwen3.8-27B 的 q80 量化版,128k 上下文。为腾出显存放上下文,他不得不剥离模型的 mmproj 多模态部分。想要更大的模型跑夜间任务,但苦于找不到考虑上下文开销后能塞进约 48GB 的多模态模型,目前在需要长上下文时以 256k 窗口重跑 Qwen3.8。帖内有具体的显存取舍经验,评论区在讨论 48GB 规模的模型选择。
「Infra」频道最新
- 分析师估算:Instinct 类应用每年或烧掉上亿美元 token 成本 — ivan_bezdomny · 2026-09-12
- 17B 模型从 SSD 跑起:单核 33 tokens/s,无 GPU 训练 — Just_Vugg_PolyMCP · 2026-09-12
- LMStudio 支持 llama.cpp 参数覆盖,yarn-attn-factor 1.2 或提升创意 — Extraaltodeus · 2026-09-12
- 分析师披露 Apple S11、A20、M6 芯片新封装与端侧 AI 设计细节 — BenBajarin · 2026-09-12
- Ben Bajarin 报告:定制芯片转向程序责任之争,Agentic AI 进军网络防御 — BenBajarin · 2026-09-12
- Spanda:Rust 引擎把幻觉检测延迟压到 760 纳秒,零 GPU — liquidngas · 2026-09-12