Marigold V2 发布:单步 DiT 深度估计,单张 32GB 消费级 GPU 可训
_akhaliq · x · 2026-09-10
Marigold V2(将亮相 SIGGRAPH Asia 2026)把单目深度估计升级到扩散 Transformer 架构:单步推理、边缘锐利、2K 分辨率不 OOM。网站、代码、权重与在线 Demo 全部公开。
- 面向小实验室:基于 Qwen-Image-Edit-2509 大 DiT,4-bit 量化 + rank-128 QLoRA,在单张 32GB 消费级 GPU 上数小时得到合理深度、几天完成训练,无需 80GB 或 8 卡机。
- 非常规设计:V1 曾把深度图塞进图像 VAE(反直觉但有效);V2 把 ground-truth 深度经 DINOv2/DINOv3 编码并对齐 DiT 特征(iREPA-depth)。
- 数据洞察:即使最干净的合成数据 Hypersim,放大到草叶级别深度标注也是坏的;因此提出对噪声标签宽容的 SinkLoss,不做逐像素对应。
- 90 秒讲解视频已发布。
所属事件:Marigold V2 发布:单卡训练的 DiT 深度估计器(11 条相关)→
「研究」频道最新
- 哈工大提出 EASE:证据锚定空间注意力,让多模态 RLVR 答对也看对地方 — jiqizhixin · 2026-09-11
- P=NP 到底难在哪:排课表与电路布线才是真正的硬骨头 — thesaraharminta · 2026-09-11
- 技术假说:ASI 会因数学激励而永久保护人类多样性 — No_Cause_2731 · 2026-09-11
- MutexaGPT:LLM翻译直觉,分子动力学筛选酶突变,命中率40% — bravo_abad · 2026-09-11
- 单作者ECCV 2026论文:让卷帘快门失真修正实用化 — ducha_aiki · 2026-09-11
- MetroLLM-Bench:小模型微调后可在交通自助机任务上比肩大模型 — continker · 2026-09-11