李飞飞团队详解世界模型 Atlas:新视角预测或是下一个 token prediction
a16z · youtube · 2026-09-04
a16z 播客邀请 World Labs 三位联合创始人李飞飞、Justin Johnson、Ben Mildenhall 对谈其最新世界模型 Atlas 及空间智能的路线判断。
核心内容:
- Atlas 的核心是「新视角预测」(new view prediction):给定一个场景的部分视角,模型预测从空间和时间中另一位置看过去的样子,把生成与 3D 重建统一进同一个模型
- 团队认为视角预测可能成为理解物理世界的有用原语,类比「下一个 token 预测」之于语言模型
- 讨论了模型背后的技术押注、当前能捕捉与不能捕捉的东西,以及 dynamics(动态)、可编辑性、仿真能力对世界模型发展的意义
- 回应「这到底是放大版视频模型还是新架构」的质疑,并探讨视频模型与世界模型的分野、能否做出可穿行的 4D 视频
- 应用场景覆盖创意工作、游戏、建筑与机器人;李飞飞认为机器人当前最大瓶颈之一是真实世界训练数据的获取
节目附完整时间戳与 World Labs 博客链接。
「多模态」频道最新
- 用户用 Grok Build 全自动剪出 Tesla Cybercab 电影感视频 — elonmusk · 2026-09-04
- 用 60 张童年照片微调 SDXL,模拟「记忆回忆」的实验 — uisato · 2026-09-04
- 用 MiniMax H3 复刻 X 热门打斗短片,参考图一致性全程保持 — MixZealousideal9359 · 2026-09-04
- Midjourney 单词提示实验:一个古方言词 Sillion 出图 — tisch_eins · 2026-09-04
- 一条 prompt 生成可逛的 3D 水族馆:Claude 加 Thrixel 新玩法 — RanaHanocka · 2026-09-04
- 多位创作者展示 AI 实验:联觉 MIDI、动画与抽象画 — floguo · 2026-09-04