一张 32GB 消费级显卡微调 Qwen-Image-Edit 变深度估计器,几天搞定
AntonObukhov1 · x · 2026-09-09
Marigold V2 作者 Anton Obukhov 公开低成本复现配方:
- 拿一个预训练 DiT(具体用了 Qwen-Image-Edit-2509)
- 量化到 4-bit
- 加 rank-128 的 QLoRA
- 在单张 32GB 消费级 GPU 上微调
几小时得到合理的深度输出,整个项目几天完成——不需要 80GB 显存,也不需要 8 卡节点。推理只需单步,2K 分辨率也不会 OOM。论文、代码、权重和 demo 链接齐全。
这是把大预训练模型低成本改造成专用感知模型的教科书式流程,普通研究者完全可以照搬。
所属事件:Marigold V2 发布:单卡微调 DiT 做深度估计(5 条相关)→
「多模态」频道最新
- CapCut 桌面版接入 Seedance 2.5:单次生成 30 秒视频 — future_coded · 2026-09-09
- 组合两种 Seedance 2.5 提示词技巧,一条长镜头做出多镜头剪辑效果 — techhalla · 2026-09-09
- 100 个规则验证器加 300 项任务,团队为视频模型打造可验证 RL 训练配方 — DanielKhashabi · 2026-09-09
- 博主称 H3 MAX 配对提示词可当渲染引擎,预告放出实操演示 — gorkem · 2026-09-09
- Gradium 发布 Voice Design:一句话描述即生成配音声线 — ThePeterMick · 2026-09-09
- 用「GPT 6 Astra」在 Spline 里做行走会自纠碰撞的机器人 — dunkhippo33 · 2026-09-09