From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation
Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zhengze Xu, Hao Yan, Yuhang Yu, Mingzhou Zhang, Mengting Chen
cs.CV, cs.AI
2026-08-19
阿里把数据构建单元从「任务数据集」改成「生成能力」,三个专用引擎产出 4.4 亿张 T2I 图、1.2 亿对编辑对、2700 万图文实体对,配五阶段课程从 256px 训到 1024px,从零训出 3B/6B 双尺度生成编辑一体模型。
现代图像生成管线(Qwen-Image、Seedream)都在数据规模、过滤、重写、语义均衡上重投入,但它们几乎都按任务切数据:T2I 一套图文对,编辑一套三元组,各自独立优化。这个组织方式漏掉了一个事实:生成能力不是同时涌现的,它们有依赖顺序。语义对齐学到的概念可以被结构化生成和编辑复用,简单内容是高分辨率复杂内容的基础。数据的价值不只取决于质量,还取决于它瞄准的能力、以及与其他样本的关系。
对通用生成模型(既做 T2I 又做编辑)这个问题是中心性的:如果每类任务的数据都要独立覆盖全部视觉概念,成本不可承受,监督也无法互相借力。
框架把数据当作「能力驱动的基础设施」,两个耦合组件。
三个专用但可互操作的数据引擎:T2I 引擎从十亿级图池里筛出 4.4 亿张,做长尾概念扩充,保留一小部分带缺陷的图并在字幕里明确描述缺陷(让模型学会识别并避免复现);编辑引擎产 1.2 亿对,除了反向构造(用 SAM3 分割做增删改、属性修改),重点从天然关联图对里挖编辑关系:同一网页的共现图、视频相邻帧、电商同款商品图、多格拼图拆解(使用前后对比、套装与组件),比纯合成对更真实;知识引擎从 Wikidata 一亿实体出发做 PageRank,筛出 300 万高显著度实体,配图后得 2700 万图-实体对。
字幕是跨任务桥:编辑指令继承 T2I 字幕的词汇和描述结构,目标图描述里能从源图直接保留的部分替换成 [image N] 引用,只有真正变化的部分用文字表达。这样 T2I 学到的概念直接迁移给编辑,编辑数据不必重复覆盖视觉概念。两个基于 Qwen3.5-27B 的字幕专家(通用 + 稠密)用 SFT 加多维奖励 RL 训成,稠密字幕按图类型(照片按主体-场景-构图,海报按布局-文本块)逐项核验后拼装。
五阶段课程沿能力获取顺序推进:256px 大规模 T2I 预训练建立语义覆盖,256/512px 引入复杂结构、知识与文字密集内容,512px 联合 T2I+编辑预训练,512/1024px 持续训练收紧到高保真源,最后 1024px SFT 用 VLM 初筛加人工复审的小规模精选集。四条轴(任务构成、概念分布、质量、分辨率)联动演进,不是定死一个配比。能力感知的评估回路把中间检查点的失败案例变成数据信号:按失败模式检索邻域样本、调专家构造、对持续失败加重采样权重。
从零训练 3B 和 6B 两个 MM-DiT 尺寸。定量只在 CPI-Bench 的两个子集上做:
| 模型 | CPI-General | CPI-Practical | Overall |
| 3B | 3.95 | 3.91 | 3.93 |
| 6B | 3.96 | 3.92 | 3.94 |
CPI-General 覆盖 30 类基础编辑(2039 例),CPI-Practical 覆盖 51 类真实应用场景(558 例),VLM 按多维打 1 到 5 分。定性对比放在 Flux.2-klein-9B、Qwen-Image-Edit-2511、FireRed-Image-Edit、JoyAI-Image-Edit-Plus 旁边,展示混合编辑、推理型编辑、退化感知修复、多图组合编辑等场景。
数字上需要诚实:两个尺寸只差 0.01 分,3B 与 6B 的区分度没有体现;论文没有给出与上述四个竞品在 CPI-Bench 上的定量对照,也没有 T2I 侧的标准基准数字,能力评估主要靠定性样张和流程内回路。数据工程本身的产出(拼图拆解回收编辑对、缺陷图显式标注、T2I 字幕桥)是这篇实际交付的东西。
对做大模型数据的人,这是「数据组织是与规模正交的一条轴」的完整工程示范:引擎怎么分工、字幕怎么跨任务对齐、课程怎么排、失败怎么回流,每一环都有可抄的具体做法。按能力而非任务切数据,让每个引擎只需覆盖自己负责的概念子集,长尾概念在 T2I 里建一次就能被编辑复用,这个思路对算力受限的团队同样适用。五阶段课程与能力回路给出了多任务生成训练一个比固定配比更合理的骨架。
定量证据薄是最大短板:核心评测只有 CPI-Bench 两个子集、一张四行表,3B 与 6B 几乎同分反而说明该基准对模型规模不敏感或样本太少;与竞品的定量对比缺失,定性图的说服力有限。数据管线的每个组件(缺陷图保留、拼图挖矿、字幕桥)没有单独消融,「能力驱动比任务驱动好」的因果主张没有直接实验支撑,读者看到的是一套自洽的工程而非受控比较。5.87 亿张图、十亿级图池的成本门槛让复现基本不可能。数据来源(网页、电商、社交)的版权与合规问题全文未提。