智象未来 DreamWorld:几何先行两阶段生成,3D 一致世界建模登 ECCV 2026
机器之心 · wechat · 2026-08-19
智象未来(HiDream.ai)提出 DreamWorld,已被 ECCV 2026 录用,解决相机控制视频扩散模型在大视角变化下几何结构不合理、物体形变、跨视角不一致的问题。核心思路是把 3D 基础模型的空间结构先验引入视频扩散,采用 Geometry-then-Appearance 两阶段框架:先用 Geometry Video Diffusion 在几何特征空间中,基于单张图像和相机轨迹,通过 feature-level flow matching 补全目标视角的完整几何表示;再由 Appearance Video Diffusion 以几何特征为条件生成最终 RGB 视频。
相比直接在 RGB 空间完成所有生成,这种几何-外观解耦让结构推理与高质量渲染各自专注,DreamWorld 在 RealEstate10K、Tanks-and-Temples 的 Novel View Synthesis 上取得领先,并在 WorldScore 上获得 75.04 平均分,3D 一致性等指标表现更佳。
「多模态」频道最新
- 评价 Suno:生成音乐仍难听且易识别 — eschadiol · 2026-08-19
- ComfyUI 实战:MiniMax 长视频分段放大与拼接工作流 — Francky_B · 2026-08-19
- 求助:MiniMax H3 视频生视频无法替换角色或跑偏 — NekoBerry420 · 2026-08-19
- Verticals v3:0.11 美元全自动生成 YouTube Shorts — tom_doerr · 2026-08-19
- 让AI独自做梦7小时:100段场景无缝续写一夜 — wine_dark · 2026-08-19
- 京东七夕推赛博晚会,JoyAvatar数字人主演 — 京东JoyAI · 2026-08-19