单张图像重建 3D 场景:Building Rome 项目可见范围外几何也补全
jonstephens85 · x · 2026-10-09
Applied Intuition 与普渡、UIUC、伯克利合作发布「Building Rome from a Single Image」,从单张输入图重建完整 3D 场景,能补全视野之外的几何,覆盖室内、室外与大规模场景,不依赖生成多视角假图再用 SfM 重建。
方法要点:
- 自适应场景分块:分块随距离增大,近处保细节、远处盖大范围建筑
- 显式 2D-3D 条件化:图像特征提升到可见表面,每个 voxel 标记空闲/可见/遮挡
- 自回归生成:相邻分块复用重叠 latent,保证新增几何与场景一致
与 World Tracing、GenRecon、VolFill、Lyra 2.0 有对比展示,论文已放出 arXiv,代码即将开源,网页提供可交互的轨道/缩放/测距演示(mesh 简化到约 150 万面)。
「多模态」频道最新
- Krea2-Turbo 对决 Qwen 2.1:5 组提示词盲测对比 — Murky-Relation481 · 2026-10-09
- Runway 携手 Claude Motion:图表动画一步转视频生成 — tlakomy · 2026-10-09
- Epic 官方推出 Unreal MCP,让 Claude Code 直接驱动虚幻编辑器 — Scobleizer · 2026-10-09
- 字节 Dreamina 推首个 AI 影视厂牌,单片最高 1500 万积分 — lmoroney · 2026-10-09
- 团队用视频模型跑「GTA 6 泄露」片段,每个超车都没漏 — markjeffrey · 2026-10-09
- LightOnOCR-3 无缝提取德语文档中难读部分实测 — IgorCarron · 2026-10-09