UniWorld-View 登顶 WorldScore,支持可控新视角视频
量子位 · wechat · 2026-07-24
UniWorld-View 登顶世界模型榜单,主打可控新视角与 4D 重建
文章介绍了兔展智能联合北大、鹏城实验室研发的 UniWorld-View:它在 WorldScore 榜单上拿到新榜首,支持用一张图或一段视频生成新视角视频,并且能做很细的相机控制,比如推、拉、摇、移,甚至绕场景 360° 转一圈。
这套方法解决了什么
- 同一套模型同时覆盖 单图 3D 生成 和 视频 4D 生成。
- 训练数据来自 元空智能。
- 代码和权重已全部开源,并适配了国产 昇腾 算力。
- 目标是把“随手拍的视频”变成可自由控制机位的世界模型输入。
核心技术思路
文章重点讲了两处改进:
- 遮挡感知点云渲染:通过“双重投影”找出回不来的像素,用遮挡 mask 留洞,让生成模型补洞,而不是把错误纹理硬塞进结果里;再用法向过滤去掉背向相机的点,减少背面漏光。
- 双流条件注入:
- 几何流 用点云渲染图 + mask 约束结构,保证画面对齐目标视角;
- 外观流 通过新设计的 Ref-DiT,让目标视角去源视频里做 cross-attention,自动“翻素材”补纹理和细节。
为什么它还能做 4D 重建
UniWorld-View 把时间和相机运动解耦:先冻结时间生成一圈静态环绕视图作为锚点,再在固定机位上生成同步多视角视频,最后喂给 4DGS 优化,就能把单目视频推进到可漫游的动态 4D 场景。
整体来看,这篇文章讲的是一条从新视角合成走向可控世界生成与 4D 重建的完整技术路线。
「多模态」频道最新
- 一期 AI 电影评测节目,追问生成式电影是否开始成片 — DavidmComfort · 2026-07-24
- Reddit 对比 ComfyUI 和闭源模型:谁更适合真人级图像 — AnyEggplant4000 · 2026-07-24
- NVIDIA 推出四步蒸馏版 Qwen-Image-Flash 图像模型 — Dante_77A · 2026-07-24
- LTX-2.3 用 Clean Plate 把泰坦尼克甲板做成去情绪化 demo — Pase4nik_Fedot · 2026-07-24
- Kimi K3 实测:把 36 秒发布片重建成可编辑代码 — Tight-Switch819 · 2026-07-24
- Kimi K3 接入 Blender MCP,可直接搭建并修正 3D 场景 — CSProfKGD · 2026-07-24