专题 · FULL STORY

World Labs 发布 Atlas:空间智能世界模型落地

9月2日,李飞飞联合创立的 World Labs 发布全球首个多模态世界模型 Atlas,主打空间智能,可将少量现实录像转化为可控交互式仿真以加速机器人训练。发布当天社区随即验证其输出可靠到可蒸馏出显式 3D 网格,引发技术热议。

2026-09-02 ~ 2026-09-02 · 3 集 · 54 条

第 1 集 · World Labs 发布 Atlas 空间智能世界模型(2026-09-02,46 条)

9 月 2 日,李飞飞创立的 World Labs 正式发布下一代世界模型 Atlas,官方称其为全球首个多模态世界模型,定位为面向空间智能的全模态世界模型,数周内开放早期访问。当前社区反应普遍积极,多位演示者展示了单图 3D 场景补全、三机位 4D 重建、机器人仿真数据生成等此前难以实现的能力,被视为空间智能方向的标志性进展。

已确认

  • 架构:Atlas 基于单一统一架构——一个从零预训练的多模态自回归扩散 Transformer,融合了现代 LLM 与视频模型在架构、算法与系统层面的进步;所有输入模态汇入共享「空间上下文」,生成结果在 3D 上保持一致。
  • 模态与能力:原生处理文本、图像、视频、相机姿态与深度等多种模态(含 3D 输入),从场景输入中构建持久空间理解;可从单张输入图像重建并补全大场景(XRarchitect 演示了单图生成完整 3D 场景,技术栈结合 Atlas、spark.js 与 three.js);通过重构视频模拟时空;原生输出 3D 空间;可将多张姿态图像合成为一致的 3D 世界;生成图像与视频帧时支持像素级相机控制,视频最长 1 分钟、分辨率可达 1440p。
  • 4D/动态重建:markk 演示仅用 3 台摄像机输入即可重建高保真 4D 视频,认为这种效果此前完全不可能实现;venturetwins 也展示了基于三台手机固定机位素材重建完整场景、从全新角度重新拍摄视频的能力。
  • 3D 重建表现:李飞飞转发称,Atlas 从单张到多张输入图像显式输出 3D 结构,性能超越顶级开源重建模型,且随输入图像增多、上下文更丰富,幻觉(想象部分)更少。
  • 机器人仿真:只需少量照片即可重建一个空间,并生成任意轨迹下机器人传感器会观测到的照片级 RGB 与深度数据,使机器人能在远多于以往的空间中训练与测试。
  • 影视应用:Jon Barron 转述团队演示称,利用 Atlas 对空间结构与时间演变的理解,用 35 部手机即可搭建「子弹时间」多视角拍摄工作室,捕捉冻结时间的动态瞬间,还能补全相机实际未拍到的场景并在时间静止状态下重新构图运镜。
  • 业界评价:BenMildenhall 指出 Atlas 不只是强大的文生图生成器,还具有丰富的「世界知识」,在单视图和多视图任务上均具通用性,可在高度风格化场景中做精确 3D 控制;gowthamis 评价 Atlas 是基于简单自回归设计框架的相机条件视觉生成模型,能灵活执行多种任务,生成质量与易用性突出。

为什么重要

  • Atlas 将世界生成从平面图像/视频推进到原生 3D 空间与时空模拟,是空间智能方向的代表性进展。
  • 其传感器级仿真数据生成能力直接面向机器人训练这一高价值场景,有望显著扩展机器人可测试环境的规模与多样性;低成本多视角重建能力也为影视创作与后期制作打开了新空间。

还有 26 条相关讨论 →

第 2 集 · World Labs 发布 Atlas 世界模型加速机器人训练(2026-09-02,4 条)

李飞飞联合创立的 World Labs 发布专注于空间智能的多模态世界模型 Atlas,可将少量现实场景录像转化为可控物体、运动、灯光与环境的交互式仿真,实现 real2sim2real 流程。业界评论认为,这一能力有望加速人形机器人在工厂、仓库、建筑工地等真实场景的训练与部署,使其进入工作场所前即可在仿真中重建场景并捕捉物体交互。

第 3 集 · 社区验证:Atlas 输出可蒸馏出显式 3D 网格(2026-09-02,4 条)

围绕 Atlas 模型能否还原显式 3D 表征,社区展开技术探讨。Keenan Crane 提出疑问后,有网友验证了 Atlas 的输出足够可靠,可以蒸馏出显式表面网格,且提取网格的法线与 3DGS 渲染结果高度一致,尤其适用于单图生成场景。讨论还指出 3DGS 的视觉细节多来自着色而非精细几何,Crane 补充认为显式网格可能是比 3DGS 更好的重建目标,因为后者主要重现外观。