DeepMind 研究员谈世界模型:第一人称多模态数据是未来

Google DeepMind 杰出工程师、Gemini 与机器人方向重要研究者 Jakob Engel 发表关于世界模型的论述,引发社区讨论。研究者 @duchaaiki 分享观察:让人类与视觉语言模型分别凭记忆或文字描述重建图像时,两者输出惊人相似,这一现象被引申至世界模型的讨论。Engel 提出判断:未来的基础世界模型将构建于并面向自我中心(第一人称)、多视角、多模态的数据。

2026-09-09 ~ 2026-09-09 · 4 条相关