阿里 CPI-Bench:推理编辑把开源闭源差距拉到 2.2 分,排名与人类 Arena 最齐

CPI-Bench: A Comprehensive,Practical and Intelligent Benchmark for Real-World Image Editing

Qinye Zhou, Jun Zheng, Yongchao Du, Yuan Wang, Zhengrui Chen, Zuan Gao, Taihang Hu, Chao Lin, Yefeng Shen, Xingjian Wang, Zhao Wang, Zhengtao Wu, Xiaoli Xu, Zhengze Xu, Hao Yan, Denghui Yang, Yuhang Yu, Huayu Zhang, Mingzhou Zhang, Mengting Chen

cs.CV

2026-08-15

阿里构建 3778 样本的图像编辑评测,补上多图编辑与推理编辑两块空白;GPT-Image-2 综合 4.77 分,最强开源模型只有 3.37,且模型排名与 Arena 人类榜几乎一致。

这篇在解决什么

图像编辑模型这两年冲得很快,GPT-Image-2、Nano Banana Pro 已经能按图文交错指令改图。但评测还停在单图简单任务:GEdit-Bench 606 样本、ImgEdit 811 样本,主要覆盖「把裙子改成红色」这类基础操作。两个真空地带被绕开了。一是多图编辑,把图 1 的火锅汤底换成图 2 的汤这种跨图指令,现有基准完全不测。二是真实部署场景,ID 照生成、电商海报、虚拟家具摆放,学术分数和能不能上线是两回事。

结果就是分数饱和:在老基准上,主流模型的成绩挤在 4.0 分上下,模型间方差只有 0.040.06,基本分不出高下。选型和迭代都缺依据。

方法

CPI-Bench 分三个子集,难度递进。

评分用 VLM 做裁判,按任务定制打分提示词,三个维度各打 15 分:指令遵循、视觉自然度、物理与细节一致性。文本编辑任务换用文字合规/文字质量/整体质量三件套。数据管线是四步:自顶向下加自底向上定类目、十万张图池配专用图池、VLM 批量生成指令加人工多轮过滤、人脸全部用换脸技术匿名化后二次人工核验。

结果

10 个模型、三个老基准对照。关键数字:

维度头部闭源头部开源差距
CPI-General(单图)GPT-Image-2 4.74FireRed 4.560.18
CPI-General(多图)GPT-Image-2 4.51Qwen-Edit-2511 3.620.89
CPI-PracticalGPT-Image-2 4.69FireRed 3.431.26
CPI-IntelligentGPT-Image-2 4.77FireRed 3.741.03
CPI-OverallGPT-Image-2 4.77Qwen-Edit-2511 3.371.40

三个结构性事实。第一,单图任务已经饱和,大家都在 4.5 上下,分不出模型好坏;多图任务闭源普遍过 4.0,开源普遍卡在 3.0 附近,瓶颈定位非常清晰。第二,Practical 子集里开源模型在中文英翻译一栏集体崩到 1.01.5 分,这是最刺眼的单项短板。第三,模型间总体方差:老基准 0.040.06,CPI-Intelligent 拉到 0.73,放大了十倍以上,这才叫有区分度。

与 Arena 人类榜的对齐是这套基准的信用背书:CPI-Bench 的模型排名与 Arena 几乎逐位一致,只有 FLUX.2-klein-9B 差一位,Spearman 相关系数在所有被测基准里最高、MAE 最低。GEdit、ImgEdit、REDEdit 三个老基准的排名趋势则明显发散。

为什么重要

对做图像编辑的团队,这张表就是一张短板清单:开源路线要追闭源,优先补多图一致性和推理编辑,单图基础编辑不值得再卷。对选型的人,Practical 子集直接对应业务上线场景,比看总分更有用。方法论上,「与人类 Arena 排名对齐」这个验证动作值得抄,自动基准最大的风险是测偏,拿人类偏好榜当锚点是性价比最高的校准方式。

局限与存疑

基准由阿里出品,Seedream 系列是阿里自家模型,在 Table 1 里 Seedream5 Pro 排第二;虽然 Arena 对齐这个外部锚点能缓解嫌疑,但任务类目设计上是否有利于自家产品,论文没有讨论。VLM 裁判本身的可靠性只通过 Arena 对齐间接验证,没有报告裁判与人工评分的一致率。CPI-Intelligent 直接复用自家 ExpertVerse 数据,独立性弱一些。样本量分布也不均,General 2039 对 Practical 558,后者按 51 个任务摊下来每类只有约 11 条,单项分数的噪声不会小。

术语

原文与代码

相关论文

全部论文解读