Reasoning-Informed Visual Editing
Xue Yang, Peiyuan Zhang, Yilun Zhu, Qihao Yang, Mingxin Liu, Xiangyu Zhao, Ziqian Fan, Zhaokai Wang, Yan Li, Yifan Yang, Xu Yang, Xiaosong Jia, Yue Zhou, Zhihang Zhong, Junchi Yan
cs.CV
2026-10-09
上海交大牵头发布千题基准 RISEBench++,中英双语评测 58 个图像编辑模型。GPT-Image-2.5 Sunburst 严格准确率 56.6% 居首,逻辑题降到 27.0%,开源最高仅 23.0%。
改颜色、换物体、调光影,现有编辑模型已经能做。指令一旦要求先推断改完的画面,例如十分钟后的化学反应、按地图标出当前位置,成功率就掉下去。扩散编辑器把功夫花在外观上,推断目标状态这件事没被单独练过。
直白指令的基准覆盖不了这件事。上一版 RISEBench 是 NeurIPS 2025 Datasets and Benchmarks 的 Oral(前 0.35%),360 题、四类推理,参评模型不到 10 个。
RISEBench++ 收成三层:6 个维度、12 个子类、65 种细任务,1000 道人工标注题,中英各一份。时间、因果、空间、逻辑各 200 题,反事实和混合各 100 题。混合题每题 3 到 5 轮,后一轮接着前一轮的画面改。
时间和因果偏世界知识,知识够用时目标状态不用绕很多步。空间和逻辑偏感知,得先从画面读出结构或规则。反事实要在常识之上故意改写规则。
三项分数都从 1 到 5,再换算成百分制。指令推理对简单场景用参考描述,逻辑和空间用参考图。外观一致性检查不该动的区域。自然图像连续打分。逻辑题的简图改成二分,保住给 5,跑偏给 1。视觉合理性只看改过的区域,反事实不因违背物理扣分。三项同时满分才算做对,准确率是做对的比例。Gemini-3-Flash 打前两项,Gemini-3.1-Flash-Lite 打第三项。
RISE-Agent 免训练,把推断和绘制拆开。规划器 GPT-5.1 可以直接推理,也可以检索,或调用 7 个代码工具,覆盖算术、日期、最短路、数独、坐标几何和矩阵变换。执行器默认是开源 FLUX.2 Klein 9B,另有 12 个确定性操作,画线、填多边形、改文字、上色、移动内容,未选中的像素保持不动。校验器 Gemini-3-Flash 在通过、局部修补和重规划里选一个,重规划最多 1 次,修补最多 2 次。
英文总分,GPT-Image-2.5 Sunburst 56.6%,Nano Banana Pro 54.6%,Nano Banana 2 50.8%。GPT-Image-2、GPT-Image-2.5 Flare、Luma Uni-1 和 Qwen-Image-3.0 大约在 45%。开源最高是 HunyuanImage-3.0-Instruct 的 23.0%,Qwen-Image-Edit-2511 为 17.1%。单图设置下 RISE-Agent 48.3%,MindBrush 21.8%,InterleaveThinker 20.6%,IntentEdit 13.2%,ImAgent 3.5%。RISE-Agent 全量 48.0%,其余 agent 不做多图,没有全量分。
Sunburst 的时间、因果、空间、反事实是 67.5%、69.0%、64.0%、72.0%,逻辑 27.0%,混合 39.0%。Nano Banana Pro 因果 71.0%,逻辑和混合只有 36.0% 和 38.0%。隐式模式归纳的闭源最高是 Qwen-Image-3.0 的 31.2%。抽看的七个模型里,模式预测都不超过 25.6%。RISE-Agent 显式规则演绎 47.2%,高于 Sunburst 的 32.5%;逻辑总分 39.0%,高于 Sunburst 的 27.0%。空间 37.5%,混合 28.0%,这两项仍落后。
中文排序和英文接近。Sunburst 55.5%,Nano Banana 2 51.0%。GPT-Image-1 从 31.8% 降到 27.2%。RISE-Agent 从 48.0% 降到 40.3%,逻辑从 39.0% 降到 25.0%。
较新模型在外观一致性和视觉合理性上已经挤在一起,指令推理的落差大得多。
消融用的是同一套准确率。裸 FLUX.2 Klein 9B 总分 12.9%,逻辑 0.5%。只加规划器,总分到 40.5%,时间从 16.0% 升到 58.0%,因果从 16.5% 升到 50.5%,逻辑仍只有 14.0%。加工具后,逻辑升到 32.0%,时间掉到 50.5%,空间从 48.0% 掉到 37.5%。校验器把时间拉回 58.5%,逻辑推到 39.0%,混合从 12.0% 升到 28.0%,空间停在 37.5%,总分 48.0%。
裁判和人的对齐只抽了 100 题、两个模型、200 张图、四位标注员。Gemini-3-Flash 的指令推理 MAE 0.48、Spearman 0.84。视觉合理性上,Gemini-3.1-Flash-Lite 的 MAE 0.27,Spearman 只有 0.41。
| 方法 | 指标 | 结果 |
| GPT-Image-2.5 Sunburst | 英文总准确率 | 56.6%,逻辑 27.0% |
| Nano Banana Pro | 英文总准确率 | 54.6% |
| RISE-Agent | 英文总准确率 | 48.0%,显式规则 47.2% |
| HunyuanImage-3.0-Instruct | 开源英文最高 | 23.0% |
| FLUX.2 Klein 9B 加全套模块 | 消融总分 | 12.9% 到 48.0% |
常识因果已经不差。GPT-Image-1.5 的因果常识 80.0%,Sunburst 78.8%,Nano Banana 2 的时间常识 77.6%。从画面里发现没写出来的规则,闭源也掉到三成上下。后面该补隐式规则和多轮。改颜色的样本再堆,这张表动不了。
最短路、数独、格子翻转这类题,生成模型常在一个符号或一条边上出错。RISE-Agent 用求解器算出目标,再用程序化操作画上去,逻辑分因此高于纯生成模型。48.0% 是 GPT-5.1 规划加上开源绘制的系统分。Klein 9B 单独只有 12.9%。
相对上一版,题量从 360 增到 1000,模型扩到 58 个,并补上多图、多轮和中文。推理仍是瓶颈。
三项同时满分才算做对。外观和合理性已经够用的模型,会因为推理差一档被记成整题失败。56.6% 是完美执行的通过率。差一格和整题想错在表上无法区分,近失比例没有公布。
人和裁判的对齐没覆盖 58 个模型。视觉合理性的 Spearman 0.41,用来排名偏弱。指令推理的裁判和 RISE-Agent 的校验器都是 Gemini-3-Flash。闭环里已经按这个裁判修补过,再用它打分,48.0% 有偏高的可能。
代码工具会帮倒忙。加上之后,时间从 58.0% 降到 50.5%,空间从 48.0% 降到 37.5%,校验器没把空间救回来。哪些调用是误触发,表里看不出来。
中英文也不对称。Sunburst 从 56.6% 到 55.5%,RISE-Agent 从 48.0% 到 40.3%。规划器还可以上网检索,同题重跑稳不稳,也没有给出。
反事实的高分要连着评分细则看。Sunburst 反事实 72.0%,高于它自己的时间推理 67.5%。违反物理不扣分,画方轮胎更接近一次风格化改写。逻辑题错一个格子就是 0。六个维度的百分数不能直接比难度。
部分开源模型没有多图分,和全量 56.6% 比会夸大差距。单图对单图仍是 56.9% 对 HunyuanImage-3.0-Instruct 的 22.5%。