VLM 与人类凭记忆重建图像的输出惊人相似
ducha_aiki · x · 2026-09-09
研究者 @duchaaiki 分享观察:让人类与视觉语言模型(VLM)分别凭记忆或文字描述重建图像时,两者产出的结果出奇地相似。相关讨论还引出 Google DeepMind 的 Jakob Engel 关于世界模型(world models)的看法,暗示这一现象对「VLM 是否真正形成类似人类的内部表征/世界模型」具有参考意义。
所属事件:DeepMind 研究员谈世界模型:第一人称多模态数据是未来(4 条相关)→
「模型」频道最新
- OpenAI 宣布 ChatGPT 用量上限调整,官方释出细则链接 — athyuttamre · 2026-09-10
- 仅 2B 参数、2GB 内存可跑:MiniCPM5-2B 展示端侧 Agent 实力 — solyarisoftware · 2026-09-10
- OpenAI 提高 Plus/Pro 用量上限,Pro $100 档额度上调 — athyuttamre · 2026-09-10
- ChatGPT 语音接入 GPT-5.6 Sol 与 GPT-6 Astra,Plus/Pro 额度同步上调 — athyuttamre · 2026-09-10
- 爆料称 DeepSeek V4.1 Flash 即将发布,V4 Pro 请求将按 Flash 价格路由 — solyarisoftware · 2026-09-10
- 厂商明确表态:不会用你的会话数据训练模型 — SumitGup · 2026-09-10