智象未来 DreamWorld:几何先行两阶段生成,3D 一致世界建模登 ECCV 2026

机器之心 · wechat · 2026-08-19

智象未来(HiDream.ai)提出 DreamWorld,已被 ECCV 2026 录用,解决相机控制视频扩散模型在大视角变化下几何结构不合理、物体形变、跨视角不一致的问题。核心思路是把 3D 基础模型的空间结构先验引入视频扩散,采用 Geometry-then-Appearance 两阶段框架:先用 Geometry Video Diffusion 在几何特征空间中,基于单张图像和相机轨迹,通过 feature-level flow matching 补全目标视角的完整几何表示;再由 Appearance Video Diffusion 以几何特征为条件生成最终 RGB 视频。

相比直接在 RGB 空间完成所有生成,这种几何-外观解耦让结构推理与高质量渲染各自专注,DreamWorld 在 RealEstate10K、Tanks-and-Temples 的 Novel View Synthesis 上取得领先,并在 WorldScore 上获得 75.04 平均分,3D 一致性等指标表现更佳。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →