UCSD 提出 WM-VLM:世界模型分支让 VLM 视觉推理提升最多 39 个百分点
UCSanDiego · hf · 2026-10-06
WM-VLM:让 VLM 用「内部世界模型」做空间推理
人类解空间问题时常在脑中模拟视觉变换,而传统视觉语言模型(VLM)主要靠语言推理。UCSD 团队提出 WM-VLM,给预训练 VLM 加上一个轻量世界模型分支,用于生成中间视觉状态,让模型能同时用文本和生成的图像进行推理。
方法
- 两阶段训练:先学会预测下一视觉状态,再学会利用该状态进行推理
- 可验证评测:程序化构造 2D/3D 心理旋转任务,中间视觉状态可程序化验证,同时衡量模型生成质量与对生成状态的依赖程度
结果
- 在 2D 和 3D 心理旋转任务上持续超越监督微调的骨干模型,最高提升 39.25 个百分点
- 消融实验显示:移除或破坏生成的视觉状态后性能骤降,说明增益确实来自内部世界模型
作者认为,内部世界模型是让 VLM 在语言与视觉空间中同时推理的有前景路径。
所属事件:UCSD 推出 WM-VLM:借助世界模型提升 VLM 空间推理(2 条相关)→
「多模态」频道最新
- 开发者用 GitHub Copilot 应用一键生成 60 秒产品宣传视频 — DanWahlin · 2026-10-06
- 腾讯发布新款开源权重视频模型,社区已可下载尝鲜 — Famous-Sport7862 · 2026-10-06
- 网友实测 Google Flow 上的 Nano Banana 2.1,人像质感惊艳 — aziz4ai · 2026-10-06
- TagScribeR 重构:本地数据集工作室集成原生 LoRA 训练 — ArchAngelAries · 2026-10-06
- ComfyUI 队列卡死排障清单:先分清校验失败还是进度丢失 — fluxdraw · 2026-10-06
- 首次用 Seedance 2.5 生成视频,结尾文字惨遭「鬼画符」 — atomantsmasher · 2026-10-06