像素空间评测显示,图像生成模型也会空间推理
OmniAI-ZJU · hf · 2026-07-24
这篇工作在做什么
ProVisE(Protocolized Visual Evaluation) 是一个与具体 benchmark 无关的评测框架,目的在于用“图像生成模型在像素空间里直接作答”的方式评估空间认知,而不是强行要求它们输出文本或坐标。
为什么需要它
很多空间任务本质上发生在连续视觉场景中,更适合用点选、标记、画图来表达;但现有 benchmark 往往要求坐标、多选或文本,和图像生成模型的表达方式不匹配。
主要组成
- 一套协议约束的视觉答案格式,可解析成结构化预测并接回原有指标
- 一个 Agentic builder,用于为新 benchmark 自动构建并验证任务协议
- SpatialGen-Bench:一个诊断型 benchmark,包含 470 个样本、14 个空间子任务、4 个能力层级和多种答案形式
结论
- 当允许模型直接在像素空间表达空间答案时,图像生成模型表现相当有竞争力。
- 但在组合式空间推理上,文本输出的 VLM 仍然更强。
- 研究还在 6 个外部空间 benchmark 上验证了协议构建的有效性。
意义
这项工作强调:评测接口本身会显著影响模型表现,像素空间表达能揭示纯文本测试看不到的能力。
「多模态」频道最新
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- AI 电影节 Lumara 将登陆纽约,顶级 AI 电影人齐聚评审 — 0xAllen_ · 2026-09-11
- 翼龙侦探:全程 AI 生成的概念片先导预告亮相 — PterodactylDetective · 2026-09-11
- Imperium 游戏预告片曝光,AI 视频生成再秀肌肉 — keaslenyt · 2026-09-11
- FLUX.2 Klein 换表情易丢脸,实测不如免费版 Gemini 保真 — wacomlover · 2026-09-11
- 腾讯 AuK 语音模型开源代码与权重上线 GitHub,附 ComfyUI 支持 — aigclink · 2026-09-11