图像版IQ测试:新基准WISRD揭示模型视觉推理短板
HirokatuKataoka · x · 2026-08-05
WISRD:图像空间规则发现基准
该论文提出了一个全新的端到端视觉推理任务 WISRD (Worksheet Image-Space Rule Discovery)。它要求图像编辑模型直接在图像空间中“做题”:读取图像中的视觉指令、发现规律,并直接在图上写出答案,全程不脱离图像模态。
核心考验
模型不仅要理解图像内容,还需要具备多种能力:
- 识别问题并推断答案
- 将答案绑定到正确的位置
- 控制输出数量并抑制不必要的多余编辑
- 保持原始输入和格式不被破坏
前沿模型实测结果
- Nano Banana Pro 表现最好,在无参考子集上通过率达 48.7%。
- Qwen-Image-Edit (13.4%)、FLUX.2 Klein 4B (约11%) 表现平平。
- InstructPix2Pix 直接交白卷 (0.0%)。
- 在附加的数独和图案推理诊断测试中,Nano Banana Pro 分别拿下了 70.0% 和 22.9% 的分数。
关键发现
当前模型甚至可以部分忽略外部文本提示,直接依赖图像内部渲染的指令进行操作。
「多模态」频道最新
- 手推14步拆解Sora:一文看懂视频生成的Diffusion Transformer原理 — ProfTomYeh · 2026-08-05
- MiniMax 视频模型实测:超长复杂提示词完美还原特摄大片质感 — Devajyoti1231 · 2026-08-05
- MiniMax H3 视频生成:消除小语种口音的实用工作流 — martinerous · 2026-08-05
- 微软发布 MAI 多模态模型,Bing 等产品替换 OpenAI 模型 — dl_weekly · 2026-08-05
- MiniMax H3视频生成:高分辨率渲染与低分辨率几乎无差,颠覆工作流 — Far-Solid3188 · 2026-08-05
- 用Wan 2.2制作动漫短片:效果诡异但有趣 — JayoTree · 2026-08-05