最强多参考图生成模型属性绑定仍只有 0.80 分,上交大 TRACE-Bench 拆出四个原子算子定位瓶颈

TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation

Haoran Wang, Chaofan Ma, Ran Yi, Lizhuang Ma

cs.CV, cs.AI

2026-08-18

把多参考图生成拆成锚定/解耦/绑定/组合四个原子算子,构建 1600 案例评测集测 9 个模型:最强的 Nano Banana 2 属性绑定也只到 0.80,场景组合却已到 0.91,瓶颈清晰定位在解耦与绑定。

这篇在解决什么

给多张参考图、生成一张组合图的场景正在变多:把 A 图的人物、B 图的上衣、C 图的背景风格拼进同一张图。各家模型(OpenAI 的 GPT-Image、Google 的 Nano Banana 系列、阿里的 Qwen-Image-Edit)都在卷这个能力,但评测方式跟不上。现有 benchmark 按预设任务类型组织,「主体组合」「风格迁移」各出一摊,覆盖零碎;同一种任务里有的案例牵扯 2 张参考图、有的牵扯 5 张,复杂度完全不受控;总分式的打分只告诉你这模型行不行,不告诉你它死在哪一步。

上海交大的做法是换一个视角:不看任务类型,看操作。任何多参考图的 prompt,不管多花哨,都可以拆成四个原子算子的组合公式。

方法

四个算子的定义:

一条 prompt 于是成了一个公式,比如「把 1 号图的人物穿上 2 号图的裙子、站在 3 号图的背景里」写成 C(f₁, Te⊕g₁)⊕gglobal。公式的结构复杂度用槽位数(slot)量化,数 f 和 g 出现的次数,TRACE-Bench 覆盖 1 到 8 槽。

基于这套形式化,他们构建了 benchmark:从 Danbooru、LAION、cc12m 里筛出约 5 万候选图,经 Gemini-2.5-Pro 结构化打标、均衡采样、人工质检后留下 3,839 张,再用 Nano Banana Pro 合成约 200 张补稀有 case;prompt 由 VLM 按公式模板生成,先过 GPT-5.4 过滤(剔除 4.3%),再人工复审(剔除 9%)。最终 631 个公式模板、约 1600 个案例,每个槽位级 180 例。

评测也按算子对齐:每个算子配一套二元判分问题(VLM judge 用 Gemini-2.5-Pro),Anchor 查实体存在与一致性,Disentangle 查属性来源正确,Apply 查绑定对没绑错人,Compose 查场景连贯、无重复无泄漏。这样每个模型拿到四张能力分,而不是一个总分。

最有设计感的是诊断树:把一个失败案例递归拆成更简单的子案例(去掉全局参考项、把场景拆成单实体、拆开多属性绑定),在每个节点重新生成打分,看它在哪一步从失败变成通过,失败源头就定位在那个被移除的组件上。

结果

9 个模型(4 个闭源:GPT-Image-1.5、Nano Banana、Nano Banana Pro、Nano Banana 2;5 个开源:Emu3.5、FireRed Image Edit 1.1、Qwen-Image-Edit-2509/2511、OmniGen2)的四项得分:

模型锚定 f解耦 g绑定 ⊕组合 C平均
Nano Banana 20.77240.73840.79890.91000.8205
Nano Banana Pro0.74880.71480.78690.92140.8172
GPT-Image-1.50.76490.68900.75410.92590.8118
Emu3.50.65870.49820.54340.78710.6561
Qwen-Image-Edit-25110.60090.40970.37420.77760.5858

三个结论:

另一个反直觉发现:锚定能力对槽位数不敏感,对参考图里的实体数量敏感。图越挤,锚定越容易丢。这说明公式复杂度不等于难度,参考图自身的杂乱程度是更直接的难度来源。

为什么重要

对做图像生成的人来说,这份 benchmark 给了一个能定位问题的坐标系统。之前发现「多参考图生成不行」,下一步只能换模型重试;现在能看出是解耦还是绑定在漏,配合诊断树还能区分「单独就不会」和「合在一起才崩」,改进方向完全不同,前者要补单能力,后者要处理参考条件之间的干扰。虚拟试穿、多人合照排版这类应用,论文也演示了如何套进同一套公式表达。

对选型的人,这张表可以直接用:闭源头部三家平均分挤在 0.81 到 0.82 之间,差距不大;开源里 Emu3.5 和 Qwen-Image-Edit-2511 领先,但在属性级的活上都还不能打。

局限与存疑

论文没有单独的 limitations 章节,以下几条是读下来的判断:

术语

原文与代码

相关论文

全部论文解读