WeeLLM:4GB 显存无损运行 FLUX.1 等大模型
AlarmingPhrase8174 · reddit · 2026-08-16
作者发布了 WeeLLM,一种层流式推理引擎,无需量化即可在低显存设备上运行大型图像生成模型。它通过逐层从磁盘加载 Transformer 层、推理后丢弃的方式,在 RTX 3050 (4GB) 上成功运行了 12B 参数的 FLUX.1-dev (峰值显存仅 1.51GB)。项目支持约 24 种模型,但依赖 NVMe SSD 的高速 I/O,目前仅支持文生图。
「编程与Agent」频道最新
- Codex技巧:让AI回顾历史会话,推荐子代理角色 — reach_vb · 2026-08-16
- 开发者长文:AI 让写代码变容易,没让软件工程变简单 — zishanverse · 2026-08-16
- 开发者用AI智能体循环2天打造多人游戏,成本仅50美元 — sharkymcstevenson2 · 2026-08-16
- 开源插件 opencode-acpx:OpenCode 直连 Cursor、Codex 等外部 Agent — intellectronica · 2026-08-16
- 如何在 Databricks 中正确配置 Genie Agent — sqlink2 · 2026-08-16
- 跨厂商多智能体协作:隔离评审上下文竟能提升代码审查效果 — rehanalliii · 2026-08-16