World Labs 发布全模态世界模型 Atlas:原生支持文本图像视频3D
theworldlabs · x · 2026-09-24
World Labs 正式发布下一代世界模型 Atlas,一个为空间智能打造的 omni(全模态)世界模型,从零预训练,原生处理文本、图像、视频与 3D。架构上是多模态自回归扩散 Transformer,所有输入合并进共享空间上下文,生成与已见内容在 3D 上保持一致的结果。
主要能力包括:
- 相机控制生成:从一张或多张图像生成像素级相机控制的图像/视频,最长 1 分钟、1440p;
- 空间重建:从 1 到数十张输入图像重建真实场景,输出新视角图像与显式 3D 结果,超越专用 3D 重建 SOTA;
- 时空模拟:从视频建模时空,支持视频重构、Real-to-Sim 机器人工作流;
- 图像生成:文生图与 360 全景,可遵循复杂提示、渲染文字。
Atlas 随训练算力增加性能持续提升,团队预期该 scaling 趋势可延续。它将驱动未来版本的 Marble 及其他产品,beta 已开放报名。
所属事件:Atlas 3D 生成工具 Chisel 开启 Beta:框出方块即可生成世界(2 条相关)→
「多模态」频道最新
- Claude Opus 5.5 一镜生成音乐视频:不算好但有意思 — NathanpmYoung · 2026-09-24
- Gemini 3.8 Flash TTS 登顶语音质量榜,Flash-Lite 同步上线 — shensi · 2026-09-24
- LemonSlice 发布 Character World Model-1:可实时对话、带情绪反应的交互数字人 — mhdfaran · 2026-09-24
- 反向玩法:用 Extract Prompt 拆解参考图视觉逻辑再二次创作 — JaynitMakwana · 2026-09-24
- 传 GPT-6 Astra 接管 Canvas 全流程,一句话产出完整视频项目(未证实) — JaynitMakwana · 2026-09-24
- MiniMax H3 生态更新:视频 VAE 提速 2.2 倍,音乐模型压到 12GB — optimisticalish · 2026-09-24