像素空间评测显示,图像生成模型也会空间推理
OmniAI-ZJU · hf · 2026-07-24
这篇工作在做什么
ProVisE(Protocolized Visual Evaluation) 是一个与具体 benchmark 无关的评测框架,目的在于用“图像生成模型在像素空间里直接作答”的方式评估空间认知,而不是强行要求它们输出文本或坐标。
为什么需要它
很多空间任务本质上发生在连续视觉场景中,更适合用点选、标记、画图来表达;但现有 benchmark 往往要求坐标、多选或文本,和图像生成模型的表达方式不匹配。
主要组成
- 一套协议约束的视觉答案格式,可解析成结构化预测并接回原有指标
- 一个 Agentic builder,用于为新 benchmark 自动构建并验证任务协议
- SpatialGen-Bench:一个诊断型 benchmark,包含 470 个样本、14 个空间子任务、4 个能力层级和多种答案形式
结论
- 当允许模型直接在像素空间表达空间答案时,图像生成模型表现相当有竞争力。
- 但在组合式空间推理上,文本输出的 VLM 仍然更强。
- 研究还在 6 个外部空间 benchmark 上验证了协议构建的有效性。
意义
这项工作强调:评测接口本身会显著影响模型表现,像素空间表达能揭示纯文本测试看不到的能力。
「多模态」频道最新
- Midjourney 把清晨场景做成了杂志感人像 — tisch_eins · 2026-07-24
- National Tequila Day 发起龙舌兰主题 AI 图像视频挑战 — LudovicCreator · 2026-07-24
- Reddit 用户让 Google AI 画出自己的工作地和人类版自我 — AddictionSorceress · 2026-07-24
- 游戏原生世界模型公布,配套 1.08 亿帧状态数据集 — Scobleizer · 2026-07-24
- 创作者用 FLUX.1 Dev 和 LTX-Video 2.3 做出 4 分钟动画短片 — developervkmp · 2026-07-24
- VCSD 去掉外部 teacher,Qwen3-VL 三个尺寸都涨分 — UMCP · 2026-07-24