4090 跑 Qwen 本地模型,上下文窗口约 32k 就爆显存
BLUECOW009 · x · 2026-10-06
一条关于本地部署现实的讨论:用户称在 4090 上跑 Qwen 3.8,上下文窗口只能开到约 32k 就会耗尽显存,对实际工作来说很受限。BLUECOW009 引用表示多数人没意识到本地运行并非可以无限扩展,长上下文本地化有硬性物理限制。
「Infra」频道最新
- R9700 32GB 本地跑 i2v 提速难:用户指 Windows 下 ROCm 表现糟糕 — vladomkd · 2026-10-06
- CutBCE:Google JAX TPU 核消除大规模推荐 BCE 训练 OOM,提速 91.9% — _reachsumit · 2026-10-06
- 8-16GB 显存新思路:通用模型编排多个领域专家小模型 — CyberExplore · 2026-10-06
- 纯浏览器跑 37GB Qwen MoE:专家权重从磁盘流式加载,输出对齐 llama.cpp — naklitechie · 2026-10-06
- 长文拆解:Nvidia 有护城河但无垄断,Google 自研 TPU 占全球算力近四分之一 — AryHHAry · 2026-10-06
- DDR5 超频实测:MoE 模型显存外推理提速最高 14% — EvolvingDior · 2026-10-06