VLM 与人类凭记忆重建图像的输出惊人相似

ducha_aiki · x · 2026-09-09

研究者 @duchaaiki 分享观察:让人类与视觉语言模型(VLM)分别凭记忆或文字描述重建图像时,两者产出的结果出奇地相似。相关讨论还引出 Google DeepMind 的 Jakob Engel 关于世界模型(world models)的看法,暗示这一现象对「VLM 是否真正形成类似人类的内部表征/世界模型」具有参考意义。

所属事件:DeepMind 研究员谈世界模型:第一人称多模态数据是未来(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →