World Labs 发布 Atlas 世界模型:文本图像视频 3D 全模态统一生成
gowthami_s · x · 2026-09-02
World Labs 发布新一代 omni 世界模型 Atlas,从零预训练,原生处理文本、图像、视频和 3D,架构为多模态自回归扩散 Transformer,把所有输入整合进共享空间上下文,生成时与已见内容保持 3D 一致。官方称其性能随训练算力扩展持续提升。
核心能力包括:
- 相机控制生成:从单张/多张图生成图像与视频,支持像素级相机控制,最长 1 分钟 1440p 视频;
- 空间重建:从 1 到数十张输入图重建真实场景,输出新视角画面与显式 3D 结果,超越专用 3D 重建 SOTA;
- 时空模拟:从视频建模空间与时间,支持视频重构图与 Real-to-Sim 机器人工作流;
- 图像生成:文生图与 360 全景,可遵循复杂提示、渲染文字、覆盖多种风格。
Atlas 将驱动未来版本的 Marble 等产品,目前已开放 waitlist。实测者称其图像与全景生成效果惊艳。
所属事件:李飞飞 World Labs 发布多模态世界模型 Atlas(20 条相关)→
「多模态」频道最新
- World Labs Atlas 单图生成完整 3D 场景 — XRarchitect · 2026-09-02
- 零素材构建人脑认知模型,AI 实时推理听觉处理 — mikeyk · 2026-09-02
- AI 制作饮料广告:眼球倒影与冷水飞溅特效 — anthara_ai · 2026-09-02
- MiniMax H3 提示词:布光织物片头效果 — umesh_ai · 2026-09-02
- 网友更关注 Meta 实时语音转录模型而非 Fable 5.1 — IndraVahan · 2026-09-02
- Fable 5.1 代码生成视频演示:从地块到建筑漫游 — alexalbert__ · 2026-09-02