OVIE 用 3000 万张无配对网图训练单目新视角合成, 快 600 倍
ducha_aiki · x · 2026-09-09
- arXiv 论文《One View Is Enough!》提出 OVIE,挑战新视角合成必须用多视图配对数据训练的惯例,证明单张图像就足够。
- 核心方法:训练时用单目深度估计器做几何脚手架——将源图像抬升为 3D,施加采样的相机变换并投影得到伪目标视图;针对遮挡区域引入掩码训练机制,将几何、感知与纹理损失限制在有效区域,从而能用 3000 万张未经筛选的互联网图像训练。
- 推理阶段完全无需深度估计器或 3D 表示,纯零样本设定下超越此前方法,且比第二名基线快 600 倍。
- 代码与模型已开源。
「多模态」频道最新
- 图像模型一大把,但 Midjourney 仍是独一档 — umesh_ai · 2026-09-09
- 爱丁堡与 ESA 推出 COP-GEN:用潜在扩散建模地球观测的不确定性 — anselm · 2026-09-09
- 团队开源迭代式音乐分离通用框架,含完整训练代码与预训练权重 — affige_yang · 2026-09-09
- GPT-Image 2.5 写实照片教程:JSON 提示控色彩,参考图保角色一致 — sven_ai · 2026-09-09
- 用参考图反推提示词:GPT Images 2.5 逼真生图流程 — sven_ai · 2026-09-09
- 用户用「gpt-6 astra」制作纳维-斯托克斯方程视觉科普 — paw_lean · 2026-09-09