4090 运行 Gemma 4 32B 频繁爆显存报错
BSPiotr · reddit · 2026-08-05
用户反馈在 RTX 4090 上本地部署 Gemma 4 32B(Q4KM,32k 上下文)时频繁遇到显存溢出(OOM)和 CUDA 错误。即使使用了 SWA 且理论显存占用符合 24GB 限制,Kobold 和 Ooba 仍会崩溃。该问题似乎仅限于 Gemma 4 系列,求助社区排查是否为 NVIDIA 配置、SWA 或 llama.cpp 底层的问题。
「Infra」频道最新
- 前 OpenAI 高管驳高盛预测:推理成本将暴降百倍,token 是极差计量单位 — ChrSzegedy · 2026-08-05
- SK海力士与三星评估在华工厂引入中微刻蚀机 — zephyr_z9 · 2026-08-05
- 英伟达开源 CuTe 代数与编译栈,加速 AI 智能体编写底层算子 — GregoryDiamos · 2026-08-05
- AMD 显卡跑本地 TTS 遇阻:Windows 端推理方案探讨 — aboutthednm · 2026-08-05
- iPhone 本地跑 1.5B 语音模型:占用仅 2.2GB — Acceptable-Cycle4645 · 2026-08-05
- 科技大V驳斥AI泡沫论:智能将接管一切物理世界 — DeryaTR_ · 2026-08-05