给图像编辑模型出 IQ 题:最强模型也只对一半,InstructPix2Pix 直接 0 分

Image-Space Rule Discovery

Misora Sugiyama, Toya Oyama, Hirokatsu Kataoka

cs.CV

2026-08-01

新基准 WISRD 把视觉推理题做成 1024×1024 工作纸,要求图像编辑模型读题、算出答案、改回图里;最强 Nano Banana Pro 也只对 48.7%,InstructPix2Pix 直接 0 分,人类 96%。

这篇在解决什么

现在的图像编辑模型(Nano Banana Pro、FLUX.2、Qwen-Image-Edit 这类)改图已经很能打,但它们到底懂不懂图里的内容?这篇不问「改得漂不漂亮」,问一个更刁钻的:给一张像 IQ 测试那样的工作纸(worksheet),模型能不能读题、看出规则、把答案直接填回图里,同时不动其它任何像素。这是一个端到端的视觉推理压力测试:既要看懂,又要精准地只改该改的地方。

方法

作者造了 WISRD(Worksheet Image-Space Rule Discovery)基准,固定 1024×1024 画布:上半部分是渲染好的文字题目,框里是待操作的图形元素。一共 11 个核心任务,分五类:标记(画交点、标中点、圈点)、填充、复制、计数(数点写数字),以及「不该改时别改」的抑制题。再叠 8 个信息条件(V0 到 V7),系统改变题目文字、外部 prompt、参考图给不给,看模型到底靠什么线索解题。另外有 4 个加难探针:多步空间操作链、RAVEN 抽象矩阵、Wason 选择逻辑题、4×4 数独。

评分用两档:Auto-Strict(严格,目标覆盖、保留黑色几何与文字与边框、原生画布格式都要对)和 Auto-Loose(放宽空间容差)。每个模型跑 11 任务 × 50 题 × 4 个无参考条件,共 2200 张输出。

结果

结果把差距拉得很开。在所有模型共享的 V0–V3 无参考子集上,Auto-Strict 通过率:Nano Banana Pro 48.7%、Qwen-Image-Edit 13.4%、FLUX.2 Klein 4B API 11.5%、FLUX.2 Klein 4B 开源版 11.3%、InstructPix2Pix 0.0%。人类在这批题上严格通过率 96.1%。

模型V0–V3 Auto-StrictAuto-Loose
Nano Banana Pro48.7%64.0%
Qwen-Image-Edit13.4%20.4%
FLUX.2 Klein 4B(API)11.5%
FLUX.2 Klein 4B(开源)11.3%
InstructPix2Pix0.0%0.0%
人类96.1%99.8%

加难探针更能说明问题。多步操作链(连续 10 到 300 步)Nano Banana Pro 仍有 92%;但抽象推理是真短板:公开 RAVEN 矩阵只有 22.9%,Wason 逻辑题精确命中 49%,4×4 数独 70%。一个值得记下的发现是,模型其实会偷偷读图里渲染的题目文字,哪怕外部 prompt 不给或只给一句通用话,只要图里印着说明,成绩就往上走(纯靠图内文字的 TXT 条件下,空间子集 Nano Banana Pro 到 88.4%)。作者还试了 OCR + Gemini 规划再渲染的诊断管线,35% strict,说明现成模型拼一拼也比直接编辑的多数模型强。

为什么重要

对做图像生成与编辑的人,这是一个直接照出「模型到底看没看懂图」的镜子。能改得好看和能按规则精确改是两回事,后者才是把编辑模型当视觉推理工具用的前提。WISRD 还顺手暴露:模型成绩高度依赖图内文字线索,这点在可控性上既是风险也是机会。对选型的人,Nano Banana Pro 在这个新维度上领先明显,但离人类还很远,空间推理和抽象规律仍是公认难点。

局限与存疑

基准本身偏「人造几何题」,跟真实照片编辑差距大,模型在这上面弱不一定代表改不了真实图。加难探针作者自己称是小规模诊断(sample size 较小),数独 70%、RAVEN 22.9% 这类数字要谨慎看。评分靠自动指标,虽然给了 Oracle 和人工核对,但「答对」的判定对格式和几何很敏感,可能低估某些「答对了但画歪一点」的情况。另外只测了五个前沿模型加一个管线,覆盖面有限。

术语

原文与代码

社区讨论

相关论文

全部论文解读