ByteDance:文生图提示词换结构化JSON,GenEval2几何均值52.8升到72.5

Scaling Properties of Text Conditioning in Visual Generation

Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan

cs.CV

2026-08-01

ByteDance发现文生图里自然语言散文再长也很快饱和,只有结构化JSON标注能持续降扩散损失、涨质量;配训练过的提示词生成器,多数基准超开源与闭源模型。

这篇在解决什么

文生图模型的训练信号来自「图-文对」。语言模型从文本流里直接学,文生图模型却要透过配文的文字去学「文字条件下的生成」。这里有个被忽视的不对称:配文含糊带过的视觉内容,只能很弱地传到模型里;配文没提的内容,根本传不进去,哪怕它在画面里明明存在。也就是说,配文里「接地」的信息量,可能从根上限死了模型能从文字里学到什么。

作者(ByteDance Seed 团队)把「文本条件」当成一个可以单独研究的训练变量,问一个直接的问题:增加这个信息量,能提升生成吗?尤其在物体、布局、关系密集的提示词上,现在的系统还很吃力。

方法

他们先做了一个固定骨干的重建探针:从一张参考图出发,把它注释成越来越长的自然语言(NL)配文,用同一个训练好的扩散模型去重建。结果重建质量很快饱和——因为这些 NL 配文只是把同样的实体和关系越说越长,没有加新信息。这说明「啰嗦」本身没用,得让视觉变量变得显式。

于是提出结构化提示词(structured prompts, SP):一个类型化的 JSON 语义表示,分成全局场景、每个元素的属性与几何、元素间关系这些命名字段,把同一份注释变成精确、可寻址的形式。重建质量随 schema 覆盖度稳步上升。

为了量化「配文信息量」,他们用了两个互补指标:GPG(接地困惑度增益,揭示配图后配文似然提升多少)和 ED(有效细节度,配文属性对图接地参考的精确率/召回率)。在一个固定训练配方下扫各种配文格式和细节度,他们发现收敛扩散损失对 GPG 是线性、对 ED 是幂律,这就是文本条件的「规模化属性」。一旦标定,就能在跑下一次训练前给候选配文条件排序。

他们把这个格式侧能力叫 diffusability(可扩散性),用「图转 SP」标注管线(VLM 加冻结的人体姿态、深度、分割专家)来提升。测试时没有配图,得靠 LLM prompter 把用户没说的视觉细节合理地补进 SP,这个能力叫 promptability(可提示性),用 SFT、冷启动蒸馏、验证器门控的 RFT(最后一阶段是在验证过的在线 rollout 上做图像条件教师的自蒸馏 OPSD)来提升,推理时再套一个 refine-render-judge 的 agentic 循环按字段修。

结果

完整系统基于 Qwen-Image 骨干,在六个基准上对比:

基准本系统对比
GenEval0.94Qwen-Image 官方 PE 0.91
GenEval2 几何均值72.552.8
DPG90.7187.20
WISE(世界知识)0.890.83
CoReBench(组合推理)85.274.7

本系统在几乎所有开源指标上领先,在多数指标上追平或超过 GPT-Image-1、Nano Banana 等闭源系统,组合与推理密集的基准优势最大。关键的对照是「matched NL」:同样的 Qwen-Image 骨干、同样的图和算力,只把接口换成自由文本配文重训。它确实涨(GenEval2 几何均值到 56.2、CoReBench 到 76.1),但仍明显低于结构化系统的 72.5 和 85.2。可见结构化这个共享接口本身就是提升的来源,不靠更大的骨干或更多训练。

Prompter 训练消融里,SFT 带来结构分最大单阶段涨幅(4.86 到 6.27);把训过的 prompter 放进推理循环,八轮时 GSB 达 54.7%,超过最强的 coding agent(44.7%,本身已是多轮)。但收益很快饱和:训过的 prompter 平均 2.31 轮就过,从 4 轮放宽到 8 轮几乎没涨。

为什么重要

这篇把文生图里一个长期被当成「配文质量」一笔带过的东西,提升成了一个有标定规律的训练变量。对做文生图训练的人,「结构化标注优于堆字数」是个可以立刻拿去用的结论,而且给出了能预测训练损失的指标(GPG、ED)。更实际的信号是:推理时按字段修比长链推理更划算,文生图不需要太长的 prompt 侧推理。

局限与存疑

这是一篇重系统、重工程的技术报告,评估高度依赖昂贵的离线裁判(GPT-5.4、Gemini),而裁判本身是会变的。骨干是 Qwen-Image,部分能力继承自骨干本身的强度,难以完全剥离。SP schema 是自家设计,迁移到别的体系要重新适配。「散文不 scale」是在他们的受控配方下成立的,换数据分布是否依旧未证。agentic 推理循环也带来额外渲染成本。

术语

原文与代码

社区讨论

相关论文

全部论文解读