双 RTX 3090 仍难同时装下 Qwen 图像编辑和 27B 文本模型
Civil_Fee_7862 · reddit · 2026-07-30
双 3090 仍然不够装下 Qwen Image Edit
这条帖在问:如何在不加硬件的情况下,把图像生成任务也塞进一套双 RTX 3090 的 AI PC 里,同时还要运行一个 4-bit 的 Qwen3.6-27B 文本模型(8-bit KV cache)。
已尝试的方案
- 减少并发流:把并发降到 1 后,vLLM 不再崩溃,256k 上下文也能保住,但每张卡只剩约 7GB 显存。
- 张量/流水线并行:可以把组合模型拆到两张卡上,但图像生成过程中某些时刻一张卡的显存还是会冲到 7GB 以上,导致 OOM。
- CPU offloading:在高负载时能把显存占用从约 18.5GB 降到约 12.8MB,但前提仍是图像模型能均匀分布到两张 GPU 上。
当前结论
作者最终在考虑再买一张 RTX 3090 专门跑图像生成,因为即使 4-bit 的 Qwen Image Edit 勉强塞进约 14GB,8-bit 版本大概率也放不下。他想确认是否有人做过类似的多 GPU 分工方案,以及有没有 PyTorch 参数能让类似 Stable Diffusion 的模型在 tensor parallelism / pipeline parallelism 下稳定工作。
「Infra」频道最新
- 台积电披露先进制程路线图:N3 量产定于 2027 年 — Beth_Kindig · 2026-07-30
- 纽约时报:海量 AI 算力即将上线,势将引发技术能力大跃迁 — coolbern · 2026-07-30
- 美光前瞻市盈率仅约5倍,分析师押注AI算力需求 — JOBhakdi · 2026-07-30
- Gavin Baker:AI 需求火热,算力租金可能继续上涨 — GavinSBaker · 2026-07-30
- NVIDIA 推 Jetson AGX Orin:275 TOPS 面向机器人和边缘 AI — NVIDIA Developer · 2026-07-30
- LiveKit 称 Gemma 4 31B 语音首 token 仅 192 毫秒 — GlennCameronjr · 2026-07-30