ComfyUI 插件优化 LoRA 加载,MiniMax-H3 显存直降 38GB

marres · reddit · 2026-08-11

ComfyUI 插件 DoRA Dynamic LoRA Loader 发布 v1.0.39 版本,引入了全新的 Runtime LoRA Bypass(运行时 LoRA 旁路)模式,有效解决了大型模型加载 LoRA 时导致的显存暴增问题。

显存优化原理

在传统的 ComfyUI 加载机制下,应用 LoRA 会生成一份完整的底层模型权重副本(即物化)。对于 MiniMax-H3 这样巨大的模型,这会导致额外占用约 38GB 的真实显存。

Runtime Bypass 模式改变了这一计算逻辑:它不再生成完整的物化权重副本,而是在前向传播(forward pass)阶段直接计算低秩 LoRA 的增量。数学上这实现了相同的转换效果,但彻底消除了大模型权重复制带来的显存开销。

实测效果与适用场景

在 MiniMax-H3 (Ref2VA pruned BF16) 的 HIGHVRAM 模式实测中,开启该功能后彻底抹去了约 38GB 的显存重复占用,且 Turbo LoRA 等依然保持正常效果。

需要注意的是,38GB 的极限节省仅发生在模型完全驻留显存的 HIGHVRAM 模式下。对于普通或低显存模式,由于系统本身已经在进行显存交换,节省的稳态显存会相对较小,但依然能减少合并时的临时内存压力。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →