DeepMind 研究员谈世界模型:第一人称多模态数据是未来
Google DeepMind 杰出工程师、Gemini 与机器人方向重要研究者 Jakob Engel 发表关于世界模型的论述,引发社区讨论。研究者 @duchaaiki 分享观察:让人类与视觉语言模型分别凭记忆或文字描述重建图像时,两者输出惊人相似,这一现象被引申至世界模型的讨论。Engel 提出判断:未来的基础世界模型将构建于并面向自我中心(第一人称)、多视角、多模态的数据。
2026-09-09 ~ 2026-09-09 · 4 条相关
- DeepMind Jakob Engel 发声谈世界模型 — ducha_aiki · 2026-09-09
- VLM 与人类凭记忆重建图像的输出惊人相似 — ducha_aiki · 2026-09-09
- VLM 与人类凭记忆重建图像的输出惊人相似 — ducha_aiki · 2026-09-09
- World 模型未来将基于第一人称多视角多模态数据 — ducha_aiki · 2026-09-09