浙大提出ProVisE:让生成模型画图证明空间认知
机器之心 · wechat · 2026-08-08
浙江大学 OmniAI 团队提出了 ProVisE 框架,改变了传统通过输出坐标或文字来评估 AI 空间认知的方式,转而让图像生成模型直接在图中“画出”答案。
ProVisE 框架机制
- 视觉协议:通过引导提示,让模型在图像上直接标记目标、生成深度图或画出运动轨迹,随后利用解析器将视觉答案还原为结构化数据进行评分。
- 自动化构建:内置 Agentic Builder,能够根据不同空间任务的输入和评分规则,自动构建并验证相应的“生成-解析”协议。
SpatialGen-Bench 测试基准
团队构建了涵盖空间感知、理解、推理和交互四个层级共 14 项子任务的测试集。
实验结论
- 生成模型的优势:在需要直接视觉感知的任务上,生成模型展现出更强的“空间直觉”,与文本模型具有明显的互补性。
- 文本模型的优势:在需要抽象推理(如计数、几何可行性判断)的任务上,文本输出 VLM 依然保持领先。
「多模态」频道最新
- Grok Imagine 2.0 实测:精准编辑图表并自动配色 — AI_Andrew · 2026-08-08
- 实测 Flux 3 生成「伪纪录片」恐怖短片 — VIV-AF-D · 2026-08-08
- 实测 Minimax H3 视频换脸:表情追踪惊艳 — MIHAWKJR007 · 2026-08-08
- 收录 324 个图像提示词与 42 种 AI 视频镜头运动 — emmanuelvivier · 2026-08-08
- 实测 H3 文生视频复刻《黑客军团》:光影惊艳但人物一致性翻车 — Positive_Writing_883 · 2026-08-08
- ComfyUI视频生成求助:蝙蝠侠战衣鳍片为何变成羽毛状? — Guyserbun007 · 2026-08-08