UCSD 推出 WM-VLM:借助世界模型提升 VLM 空间推理
人类解决空间问题时常在脑中模拟视觉变换,而传统视觉语言模型主要依赖语言推理。UCSD 团队提出 WM-VLM 范式,由内部世界模型生成中间视觉状态供 VLM 使用,从而在需要「想象力」的空间推理任务上表现显著提升,最多可达 39 个百分点的提升,并明显超越经 SFT 训练的 VLM 骨干模型。
2026-10-06 ~ 2026-10-06 · 2 条相关
- UCSD 提出 WM-VLM:世界模型分支让 VLM 视觉推理提升最多 39 个百分点 — UCSanDiego · 2026-10-06
- WM-VLM:让内部世界模型生成视觉中间态提升空间推理 — ZhitingHu · 2026-10-06