Marigold V2 训练配方:4bit 量化 DiT 加 QLoRA 单卡微调

AntonObukhov1 · x · 2026-09-09

Marigold V2 的训练配方延续了「反常规但有效」的传统:V1 曾把深度图直接塞进图像 VAE(理论上不该 work 但 work 了);V2 则把真值深度通过 DINOv3 编码,并将 DiT 特征与之对齐(iREPA-depth)。具体做法:取大型预训练 DiT(Qwen-Image-Edit-2509),量化到 4bit,加 rank-128 的 QLoRA,在一张 32GB 消费级 GPU 上微调——几小时出可用深度,几天完成训练,无需 80GB 卡或多节点。推理为单步,2K 分辨率也不会 OOM。

所属事件:Marigold V2 发布:单卡微调 DiT 做深度估计(5 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →