Swift-Image: Exploring the Performance Frontier of Compact Unified Image Generation Models
Taihang Hu, Zhao Wang, Zuan Gao, Tao Liu, Hao Yan, Zhengze Xu, Yuhang Yu, Yongchao Du, Xingjian Wang, Jun Zheng, Qinye Zhou, Zhengrui Chen, Chao Lin, Yefeng Shen, Zhengtao Wu, Ge Wu, Xiaoli Xu, Denghui Yang, Huayu Zhang, Mingzhou Zhang, Mengting Chen
cs.CV
2026-08-21
阿里用 6B 单流 DiT 统一做文生图和单图、多图编辑,训练约 243K GPU 小时。带 API Prompt Enhancer 的 6B 编辑聚合分 4.41,压过 20B 的 Qwen-Image-Edit;3B 剪枝几乎不掉点,8 步蒸馏还略涨。
开源图像模型把画质、文字渲染、按指令改图都做上去了,骨干也一起涨到十几、二十 B,生成和编辑经常还要拆成两套权重。真正卡住的问题更具体:算力封顶时,一个相对小的统一模型能被训练工程推到多远。
统一模型要同时做文生图、单图编辑、多图编辑。三类任务互相拉扯。文生图要语义覆盖和多样性;编辑要精确用上参考图,还要把没被要求改的区域保住。复杂请求再叠文字渲染、构图、领域知识和版式。容量小的模型对架构浪费和任务干扰特别敏感,一点点跷跷板就会把有限参数吃光。
Swift-Image 来自阿里。视觉骨干是 6B 并行单流 DiT,条件来自 Qwen3-VL-8B:抽三层均匀间隔的隐状态拼起来,再投影进扩散空间。VLM 吐出的图像 token 不进 DiT,消融显示加长序列没有可测收益。参考图像素走另一路,输入图和加噪目标图都经 FLUX.2 AE 编码后线性投影。
块内 Attention 和 expansion=3 的 SwiGLU MLP 并行计算。相对串行只掉一点点质量,推理大约快 10%。时间步的 scale/shift/gate 改成整网共享,单独看调制变弱,省下的参数预算给了 Attention 和 MLP。位置编码用 4D-RoPE,多图之间在时间轴上强制错开 10,减轻同坐标 token 互相吸住造成的拷贝粘贴。引号里要写进画面的字走字符级分词。
训练是粗到细的课程:
后训练不把互相冲突的奖励塞进一条策略。DiffusionNFT 并行训出文生图专家、通用编辑专家和若干垂直编辑专家。奖励覆盖对齐、美观、画质、指令遵循、参考一致性,外加 ArcFace 保脸、PP-OCRv6 管文字。CFG 只在 rollout 里开,策略更新本身不加。然后用多教师 on-policy distillation,让学生在自己采样的状态上吸收各专家。
部署走两条压缩。结构剪枝把注意力头从 32 砍到 24,得到 3B,继承存活参数后再走持续预训练,并用冻住的 6B 做速度场蒸馏。分布匹配蒸馏把采样从 50 步压到 8 步。
推理时前面再挂 Prompt Enhancer。简单请求直接改写成生成器对得上的视觉规格;知识密集或版式敏感的请求先写一段 <think>,只有最终 refinedprompt 进 DiT。PE 先 SFT 再 GRPO,视觉骨干冻住,同时打文本正确性和「这段 prompt 生成器到底画不画得出来」的图像分。
6B 骨干训练大约 243K GPU 小时。编辑 Overall 是 GEdit(先除以 2)、ImgEdit、REDEdit、CPI-General、CPI-Practical 的等权平均。
| 模型 | 参数 | 编辑 Overall |
| GPT-Image-2 | 未公开 | 4.61 |
| Seedream5 Pro | 未公开 | 4.57 |
| Swift-Image-6B + API PE | 6B | 4.41 |
| Swift-Image-3B + API PE | 3B | 4.40 |
| Swift-Image-6B(无 PE) | 6B | 4.16 |
| Qwen-Image-Edit-2511 | 20B | 4.07 |
| FLUX.2-klein-9B | 9B | 4.05 |
无 PE 的 6B 已经略高于 20B 的 Qwen-Image-Edit。自家 PE 提到 4.33,API 版 PE 到 4.41,在全部被评模型里排第三,只低于 GPT-Image-2 和 Seedream5 Pro。
知识密集编辑 CPI-Intelligent 把账算得更清楚:6B 直接提示只有 2.26,加上 PE 跳到 4.23,API PE 再多一点到 4.24。3B 同样从 2.02 到 4.10。闭源 GPT-Image-2 仍是 4.77。
文生图这边更依赖改写器。Qwen-Image-Bench 上 6B 直接提示 51.10,还略低于开源 Qwen Image 2512 的 52.06;加上 PE 到 56.33,API PE 58.13。闭源 GPT Image 2 是 64.69。Pi-ExpertVerse-T2I 上 6B 从 2.49 拉到 4.63(API PE 4.85),接近 GPT-Image-2 的 4.94。
后训练消融更干净。监督基线编辑 Overall 3.98,RL 提到 4.16,8 步 Turbo 再提到 4.20。REDEdit 从 3.98 到 4.34,实用编辑 PiPractical 从 3.69 到 3.92 再到 4.01。少步蒸馏没有把 RL 的收益吐回去,聚合分还略涨。
这篇的卖点不是新模块。单流 DiT、渐进训练、扩散 RL、prompt 改写、剪枝和少步蒸馏,单独看都不新,论文自己也这么写。能跟的是怎么把它们串成一条能在 6B 上跑通的管线。
对要自己训图模的人,三条最有用。语义覆盖必须排在偏好优化前面,太早滤画质会把长尾概念滤掉。互相打架的目标先分专家再蒸馏合并,混在一条策略里会跷跷板。Prompt Enhancer 不是把句子写长,是把用户话编译成生成器训练时见过的条件语言。知识任务上它贡献的分差,比把骨干从 3B 加到 6B 大得多。
能用的场景是要统一生图加编辑、又不想上 16B/20B 骨干的部署。带 API PE 的 3B 聚合分 4.40,和 6B 的 4.41 基本持平。少步 Turbo 把 50 步压到 8 步,编辑分从 4.16 到 4.20。
这是系统工程上的渐进改进,不是架构突破。闭源仍然明显更高:编辑 4.61 对 4.41,文生图 64.69 对 58.13。
正文没有独立的 Limitations 节。数字里能读出几处窟窿。
「6B」不含条件编码器和 Prompt Enhancer。条件侧是 Qwen3-VL-8B,PE 是另一套会组内采样多条改写的 VLM。部署成本不是一张 6B DiT 卡能概括的。API 版 PE 系统性强于论文交出的 PE:编辑 4.41 对 4.33,文生图 58.13 对 56.33。开源第一这块牌子,有一部分挂在未随骨干一起交代清楚的改写器上。
CPI-Bench 和 Pi-ExpertVerse 是同一团队的内部基准。PE 在这些套件上的涨幅最大,外部 GEdit、ImgEdit 上小得多。评测分布、训练数据和改写器是否对齐过近,论文没有排除。
无 PE 时 6B 在 CPI-Intelligent 上只有 2.26,低于 FireRed-Image-Edit 的 2.65 和 Qwen-Image-Edit-2511 的 2.54。骨干自己的知识推理并不强,强的是改写器把请求编译成可执行规格。把「统一模型很聪明」读成 DiT 会做地理和史实推理,会读过头。
少步蒸馏让编辑分上涨,只报了编辑五套分,文生图少步数字没有放进主表。3B「几乎不掉点」也主要是带 PE 之后的数字;无 PE 时 3B 是 4.15、6B 是 4.16,差距本来就在测量噪声附近。条目里没有给出 GitHub,权重、3B 和 PE 是否一起放,正文没写清楚。