OuroWorld: Bringing Any 3D World Alive as Diverse, Endlessly Looping 3D Cinemagraphs
You-Zhe Xie, Ting-Wei Chou, Yu-Hsuan Li, Kaipeng Zhang, Zhixiang Wang, Yu-Lun Liu
cs.CV, cs.GR
2026-10-09
OuroWorld 用视频模型决定怎么动,再用按周期闭合的傅里叶形变,把任意静态 3DGS 收成可环视的无限循环场景,39 个场景上用户偏好 70.8% 至 99.0%。
HY-World 2.0、Marble、Lyra 2.0 能给出可走动的照片级场景,但叶子、雾和灯光都不动。二维 cinemagraph 只在静帧局部加一段无缝循环;三维里,LoopGaussian 和 3D-MOM 用 Eulerian flow 去推 3DGS。3DGS 用大量高斯核表示场景,Eulerian flow 则在固定网格上记速度,适合烟、水和雾,做不了一般形变、物体移动和光照变化。多层深度图更早,视角一偏就穿帮。这些方法还依赖运动遮罩。
视频生成能提供多样、大致成环的运动。缺口有两个:视频只是近似周期,拟合后再循环,接头会跳;单视角约束不住四维场景,多视角生成又互相不一致,硬拟合会糊,也会抖。
OuroWorld 输入任意静态 3DGS,自己决定哪里动。实验视角是水平 ±20°。周期结束时,场景按表示回到起点。能力表里,只有它同时做到无遮罩、真三维、数学上保证成环、运动不限流体、光照可随时间变。
三步,输入只有静态 3DGS。
GPT-5.5 看渲染出的参考图,写成运动提示:要明显,可以多处一起动,不新加物体,相机固定,并且成环。Seedance 2.0 把同一张图用作首帧和尾帧,生成 10 秒、720p、24 FPS 的视频。不自然的会被滤掉。这一步取代遮罩。
VGGT-Ω 读参考视频里的 24 帧,再加 t=0 的 21 张静态环绕图稳住深度,得到逐帧点云。绕手选轴心,在 ±20° 内放 20 个相机,把点云渲成带洞的视频,TrajectoryCrafter 照参考视频补上。各视角共用一套初始噪声。
场景表示是 Inconsistency-Robust Periodic 4DGS。形变场在高斯中心查三平面(三张轴对齐的特征平面),拆成傅里叶系数:常数项加 K=4 组正弦和余弦,周期 T=10 秒,再交给宽度 128 的 MLP,输出位置、旋转、尺度、颜色的偏移。正弦余弦过一个 T 之后取值不变,所以 t 和 t+T 是同一个场景,循环写在表示里,不靠优化去碰运气。
直接拟合会平均掉矛盾观测,画面发糊。每个视角都学漂移的话,推理时一旦丢掉漂移,运动也跟着丢。参考视角因此不加漂移,形变场独自复现参考视频,其他视角只吸收残差。推理时整层漂移扔掉。
参考视频,以及输入 3DGS 在 t=0 的各视角,用 L1。其他生成帧不拿来当像素真值:当前渲染经 Stable Diffusion v1.5 加噪再去噪,潜变量被往生成帧拉,这是 SDEdit 的做法,再用 LPIPS 约束渲染贴近细化图。损失权重是 1 比 0.2。训练在一张 RTX 4090 上完成。
评测 39 个场景:Mip-NeRF 360 重建 9 个,三个世界模型各 10 个。视频长 20 秒、30 FPS、672×384。一条相机固定,一条偏航扫过 0°、20°、-20° 再回到 0°,半径为训练半径的 0.95 倍。周期保持各方法原长再重复:0.5 秒、2.4 秒、2.0 秒、2.0 秒和 10 秒,依次对应 Gaussians-to-Life、3D Cinemagraphy、3D-MOM、LoopGaussian、OuroWorld。基线的遮罩来自动态提示加 SAM 3,并经人工核对。
Vividness 在 3 FPS 上平均运动、光照和外观变化,阈值分别是短边 0.3% 的光流和 20% 的亮度变化。KVD 参照 MiniMax H3 的 780 条视频。MALF 奖励周期后回到同位相,静止得 0;Seam SSIM 只看接头。两者都只在固定机位计算。
| 方法 | Vividness ↑ | KVD ↓ | MALF ↑ | Seam SSIM ↑ |
| Gaussians-to-Life | 0.0374 | 127.47 | 0.0265 | 0.9388 |
| 3D Cinemagraphy | 0.0066 | 142.42 | 0.0134 | 0.9995 |
| LoopGaussian | 0.0024 | 154.65 | 0.0025 | 0.9998 |
| 3D-MOM | 0.0247 | 155.23 | 0.0317 | 0.9158 |
| OuroWorld | 0.0423 | 108.23 | 0.0809 | 0.9965 |
固定机位上,0.0423 对 Gaussians-to-Life 的 0.0374,领先有限。运动项反而是基线更高,MV 0.0588 对 0.0413,短周期把相邻帧的变化抬上去了,MALF 却只有 0.0265。光照项 IV 0.0518,3D-MOM 为 0.0248,Gaussians-to-Life 为 0.0170。接缝 0.9965,低于 LoopGaussian 的 0.9998 和 3D Cinemagraphy 的 0.9995。KVD 108.23,次好 127.47。
环绕时机位运动主导画面,Vividness 0.5117 对 0.5097,KVD 50.11 对 51.86。两种机位下 Aesthetic Quality 都是最好。
30 人、780 组二选一,每组 5 人。四项偏好落在 70.8% 到 99.0%。对 3D-MOM,生动和接缝都是 99.0%;对 LoopGaussian,自然和画质是 70.8%,有 29.2% 的人选几乎静止的结果。人眼拉开的差距,大于环绕指标上的小数点。
取消锚定后,固定机位 Vividness 从 0.0423 降到 0.0392,MV 从 0.0413 降到 0.0324。周期改为 2T,Seam SSIM 从 0.9965 降到 0.9783,MALF 从 0.0809 只到 0.0788。去掉扩散细化后,固定机位 Vividness 反升到 0.0450,附录把这归因于补全误差烤进场景后的闪烁;环绕 VoL 从 709.75 降到 551.33。只删漂移场,Vividness 仍为 0.0424。
已有 3DGS 或世界模型导出的场景,可以不加遮罩就做成循环:流体以外的形变、位移、灯光变化都能进同一套表示,环绕时仍然闭合。推理不带漂移场,开销是高斯光栅化加一个小 MLP。
和 Eulerian 基线比,运动种类和成环是同时解决的。和 Gaussians-to-Life 比,固定机位 Vividness 从 0.0374 到 0.0423,MALF 从 0.0265 到 0.0809,光照从 0.0170 到 0.0518。多出来的主要是可环视的闭合,不是运动突然变得剧烈。
动态上界是视频模型,不合理的生成会进成片,VLM 过滤只能减轻。二十个视角都从一条参考视频补出来,再往外看,遮挡和不一致会更重。轨道只有 ±20°,和摘要里的任意视角不是一回事。
评测没有真值。Vividness 的阈值是目视调的。KVD 把生成视频当成自然分布,方法本身在蒸馏生成视频,Eulerian 基线在这项上吃亏。换 MiniMax H3 只避开了 Seedance,没有避开这个偏差。场景挑的是本来就有水、植物、布、火或灯光的,机位手选,遮罩人工看过,39 个不能当成任意导出。周期从 0.5 秒到 10 秒,对比并不同速。换掉 GPT-5.5 和 Seedance 2.0 之后还剩多少优势,论文没测。删掉漂移场后 Vividness 仍是 0.0424,相对 0.0423 几乎不变,变糊主要见于定性图。