WorldSculpt: Generating Compositional Worlds from Grounded Videos
Muyao Niu, Jixuan He, Ruihan Yu, Lian Fu, Yonghao Yu, Zheng-Hui Huang, Yifan Zhan, Fengbo Lan, Yongtao Ge, Yinqiang Zheng, Kaipeng Zhang, Zhixiang Wang
cs.CV
2026-09-05
Alaya Lab 给 Pixal3D 加上多视图条件通路,只在单物体上微调、无需场景级训练,就能处理上百物体的遮挡场景。UE-MeshyScene 上 Chamfer-ℓ2 从 ShapeR 的 7.42 降到 2.48。
Marble、HY-World 2.0 这类世界模型能从一张图或一句提示长出可逛的三维环境,输出却是一整坨 mesh 或 Gaussian,椅子和花瓶拆不出来,也就进不了游戏引擎、物理仿真或机器人抓取。几何重建能把看见的表面对上,被挡住的地方会留洞;现有组合式生成方法又多半停在桌面几件物体或稀疏家具。
目标很具体:给定带位姿的多视图、实例掩码和粗糙三维框,把拥挤场景写成「每个物体一块独立 mesh + 一块变换」,直接能选、能搬、能仿真。
骨架是 Pixal3D 的前两级几何阶段(64³ 稀疏占用,再在占用体素上出高分辨率结构潜变量),权重冻结,只加多视图条件。
对每个物体选一个观察最完整的锚点视图,按其相机朝向搭一个边长相等的规范立方体,把各视图裁成物体中心的 crop,并用裁剪后的内参把规范体素投回图像。每张 crop 用 DINOv3 提特征,按投影位置抬到共享体素格。跨视图聚合是 IBRNet 风格:先算均值和方差,再让 MLP 出残差和权重,最后一层零初始化,训练开始时等价于简单平均。聚合后的三维条件经零初始化投影加进 Transformer block,原网络用 rank-32 的 LoRA 适配。纹理阶段这次没做。
训练全程只用 TexVerse 上的单个规范物体,随机锚点和 1 到 20 个视图。为了贴近真实遮挡,输入侧逐步加二维/三维遮挡、非锚点位姿扰动、掩码边界错误和降采样,监督目标始终是完整几何。推理时物体独立生成,再用规范到世界的相似变换放回场景,物体之间不做联合优化。
单物体 Toys4k 上,干净输入、16 视图时 CD-ℓ2 为 1.19×10⁻³,单视图 Pixal3D 是 2.17。遮挡到每视图 75% 时,16 视图仍是 2.25,单视图 Pixal3D 崩到 63.95。
组合场景用世界坐标系直接比,不做 per-object ICP:
| 方法 | HouseCat6D CD-ℓ2 | Toys4k-Scene CD-ℓ2 | F-Score(Toys4k-Scene) |
| RecGen | 7.22 | 13.2 | 0.676 |
| ShapeR | 1.26 | 8.38 | 0.746 |
| WorldSculpt | 0.28 | 0.61 | 0.981 |
UE-MeshyScene 是新基准:虚幻引擎里 6 个室内外场景,每场 93 到 701 个物体,共 2299 个资产、5964 张 2560×1440 图,带每物体真值 mesh。CD-ℓ2 从 ShapeR 的 7.42 降到 2.48,F-Score 从 0.813 升到 0.951,中位数差距比均值更大,说明不是靠少数难例拉开的。
消融里,视图多、遮挡重时学到的 IBR 聚合优于算术平均;场景级在 UE-MeshyScene 上 CD-ℓ2 从 2.83 降到 2.48。作者还把 Marble、HY-World 2.0 的 3DGS 世界转成了可拆的 mesh 场景,这一项没有定量对比。
组合式三维对下游一直是刚需,缺的是「又挤又挡」时还能出独立资产。WorldSculpt 的判断是:单物体生成先验已经够强,缺的是把多视图证据对齐进规范立方体,不必为整场做场景级训练。做重建或世界模型落地的人,如果下游要可交互物体,这条路比再训一个整场生成器更省。
几何已经能用;外观还没有,现成资产管线还接不上完整 PBR。
上游位姿、掩码和三维框仍是给定的。增强能扛中等误差,框完全放飞或掩码大错仍会坏几何。模型只出几何,Pixal3D / TRELLIS.2 的材质阶段没接上。场景被当成静态,运动或形变物体不在范围内。评测里的大场面是合成的,真实拥挤室内仍缺逐物体完整 mesh 真值。HouseCat6D 这种较稀的桌面场景上,学到的聚合和简单平均几乎打平(0.28 vs 0.27),增益主要出现在更挤、更挡的地方。