TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation
Haoran Wang, Chaofan Ma, Ran Yi, Lizhuang Ma
cs.CV, cs.AI
2026-08-18
把多参考图生成拆成锚定/解耦/绑定/组合四个原子算子,构建 1600 案例评测集测 9 个模型:最强的 Nano Banana 2 属性绑定也只到 0.80,场景组合却已到 0.91,瓶颈清晰定位在解耦与绑定。
给多张参考图、生成一张组合图的场景正在变多:把 A 图的人物、B 图的上衣、C 图的背景风格拼进同一张图。各家模型(OpenAI 的 GPT-Image、Google 的 Nano Banana 系列、阿里的 Qwen-Image-Edit)都在卷这个能力,但评测方式跟不上。现有 benchmark 按预设任务类型组织,「主体组合」「风格迁移」各出一摊,覆盖零碎;同一种任务里有的案例牵扯 2 张参考图、有的牵扯 5 张,复杂度完全不受控;总分式的打分只告诉你这模型行不行,不告诉你它死在哪一步。
上海交大的做法是换一个视角:不看任务类型,看操作。任何多参考图的 prompt,不管多花哨,都可以拆成四个原子算子的组合公式。
四个算子的定义:
一条 prompt 于是成了一个公式,比如「把 1 号图的人物穿上 2 号图的裙子、站在 3 号图的背景里」写成 C(f₁, Te⊕g₁)⊕gglobal。公式的结构复杂度用槽位数(slot)量化,数 f 和 g 出现的次数,TRACE-Bench 覆盖 1 到 8 槽。
基于这套形式化,他们构建了 benchmark:从 Danbooru、LAION、cc12m 里筛出约 5 万候选图,经 Gemini-2.5-Pro 结构化打标、均衡采样、人工质检后留下 3,839 张,再用 Nano Banana Pro 合成约 200 张补稀有 case;prompt 由 VLM 按公式模板生成,先过 GPT-5.4 过滤(剔除 4.3%),再人工复审(剔除 9%)。最终 631 个公式模板、约 1600 个案例,每个槽位级 180 例。
评测也按算子对齐:每个算子配一套二元判分问题(VLM judge 用 Gemini-2.5-Pro),Anchor 查实体存在与一致性,Disentangle 查属性来源正确,Apply 查绑定对没绑错人,Compose 查场景连贯、无重复无泄漏。这样每个模型拿到四张能力分,而不是一个总分。
最有设计感的是诊断树:把一个失败案例递归拆成更简单的子案例(去掉全局参考项、把场景拆成单实体、拆开多属性绑定),在每个节点重新生成打分,看它在哪一步从失败变成通过,失败源头就定位在那个被移除的组件上。
9 个模型(4 个闭源:GPT-Image-1.5、Nano Banana、Nano Banana Pro、Nano Banana 2;5 个开源:Emu3.5、FireRed Image Edit 1.1、Qwen-Image-Edit-2509/2511、OmniGen2)的四项得分:
| 模型 | 锚定 f | 解耦 g | 绑定 ⊕ | 组合 C | 平均 |
| Nano Banana 2 | 0.7724 | 0.7384 | 0.7989 | 0.9100 | 0.8205 |
| Nano Banana Pro | 0.7488 | 0.7148 | 0.7869 | 0.9214 | 0.8172 |
| GPT-Image-1.5 | 0.7649 | 0.6890 | 0.7541 | 0.9259 | 0.8118 |
| Emu3.5 | 0.6587 | 0.4982 | 0.5434 | 0.7871 | 0.6561 |
| Qwen-Image-Edit-2511 | 0.6009 | 0.4097 | 0.3742 | 0.7776 | 0.5858 |
三个结论:
另一个反直觉发现:锚定能力对槽位数不敏感,对参考图里的实体数量敏感。图越挤,锚定越容易丢。这说明公式复杂度不等于难度,参考图自身的杂乱程度是更直接的难度来源。
对做图像生成的人来说,这份 benchmark 给了一个能定位问题的坐标系统。之前发现「多参考图生成不行」,下一步只能换模型重试;现在能看出是解耦还是绑定在漏,配合诊断树还能区分「单独就不会」和「合在一起才崩」,改进方向完全不同,前者要补单能力,后者要处理参考条件之间的干扰。虚拟试穿、多人合照排版这类应用,论文也演示了如何套进同一套公式表达。
对选型的人,这张表可以直接用:闭源头部三家平均分挤在 0.81 到 0.82 之间,差距不大;开源里 Emu3.5 和 Qwen-Image-Edit-2511 领先,但在属性级的活上都还不能打。
论文没有单独的 limitations 章节,以下几条是读下来的判断: