Image-Space Rule Discovery
Misora Sugiyama, Toya Oyama, Hirokatsu Kataoka
cs.CV
2026-08-01
新基准 WISRD 把视觉推理题做成 1024×1024 工作纸,要求图像编辑模型读题、算出答案、改回图里;最强 Nano Banana Pro 也只对 48.7%,InstructPix2Pix 直接 0 分,人类 96%。
现在的图像编辑模型(Nano Banana Pro、FLUX.2、Qwen-Image-Edit 这类)改图已经很能打,但它们到底懂不懂图里的内容?这篇不问「改得漂不漂亮」,问一个更刁钻的:给一张像 IQ 测试那样的工作纸(worksheet),模型能不能读题、看出规则、把答案直接填回图里,同时不动其它任何像素。这是一个端到端的视觉推理压力测试:既要看懂,又要精准地只改该改的地方。
作者造了 WISRD(Worksheet Image-Space Rule Discovery)基准,固定 1024×1024 画布:上半部分是渲染好的文字题目,框里是待操作的图形元素。一共 11 个核心任务,分五类:标记(画交点、标中点、圈点)、填充、复制、计数(数点写数字),以及「不该改时别改」的抑制题。再叠 8 个信息条件(V0 到 V7),系统改变题目文字、外部 prompt、参考图给不给,看模型到底靠什么线索解题。另外有 4 个加难探针:多步空间操作链、RAVEN 抽象矩阵、Wason 选择逻辑题、4×4 数独。
评分用两档:Auto-Strict(严格,目标覆盖、保留黑色几何与文字与边框、原生画布格式都要对)和 Auto-Loose(放宽空间容差)。每个模型跑 11 任务 × 50 题 × 4 个无参考条件,共 2200 张输出。
结果把差距拉得很开。在所有模型共享的 V0–V3 无参考子集上,Auto-Strict 通过率:Nano Banana Pro 48.7%、Qwen-Image-Edit 13.4%、FLUX.2 Klein 4B API 11.5%、FLUX.2 Klein 4B 开源版 11.3%、InstructPix2Pix 0.0%。人类在这批题上严格通过率 96.1%。
| 模型 | V0–V3 Auto-Strict | Auto-Loose |
| Nano Banana Pro | 48.7% | 64.0% |
| Qwen-Image-Edit | 13.4% | 20.4% |
| FLUX.2 Klein 4B(API) | 11.5% | — |
| FLUX.2 Klein 4B(开源) | 11.3% | — |
| InstructPix2Pix | 0.0% | 0.0% |
| 人类 | 96.1% | 99.8% |
加难探针更能说明问题。多步操作链(连续 10 到 300 步)Nano Banana Pro 仍有 92%;但抽象推理是真短板:公开 RAVEN 矩阵只有 22.9%,Wason 逻辑题精确命中 49%,4×4 数独 70%。一个值得记下的发现是,模型其实会偷偷读图里渲染的题目文字,哪怕外部 prompt 不给或只给一句通用话,只要图里印着说明,成绩就往上走(纯靠图内文字的 TXT 条件下,空间子集 Nano Banana Pro 到 88.4%)。作者还试了 OCR + Gemini 规划再渲染的诊断管线,35% strict,说明现成模型拼一拼也比直接编辑的多数模型强。
对做图像生成与编辑的人,这是一个直接照出「模型到底看没看懂图」的镜子。能改得好看和能按规则精确改是两回事,后者才是把编辑模型当视觉推理工具用的前提。WISRD 还顺手暴露:模型成绩高度依赖图内文字线索,这点在可控性上既是风险也是机会。对选型的人,Nano Banana Pro 在这个新维度上领先明显,但离人类还很远,空间推理和抽象规律仍是公认难点。
基准本身偏「人造几何题」,跟真实照片编辑差距大,模型在这上面弱不一定代表改不了真实图。加难探针作者自己称是小规模诊断(sample size 较小),数独 70%、RAVEN 22.9% 这类数字要谨慎看。评分靠自动指标,虽然给了 Oracle 和人工核对,但「答对」的判定对格式和几何很敏感,可能低估某些「答对了但画歪一点」的情况。另外只测了五个前沿模型加一个管线,覆盖面有限。