WeeLLM:4GB 显存无损运行 FLUX.1 等大模型

AlarmingPhrase8174 · reddit · 2026-08-16

作者发布了 WeeLLM,一种层流式推理引擎,无需量化即可在低显存设备上运行大型图像生成模型。它通过逐层从磁盘加载 Transformer 层、推理后丢弃的方式,在 RTX 3050 (4GB) 上成功运行了 12B 参数的 FLUX.1-dev (峰值显存仅 1.51GB)。项目支持约 24 种模型,但依赖 NVMe SSD 的高速 I/O,目前仅支持文生图。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →