字节Seed研究:Caption信息量比长度更能预测文生图质量

机器之心 · wechat · 2026-08-12

ByteDance Seed 团队最新研究发现,在文生图模型中,单纯增加自然语言 Caption 的长度并不能带来更多有效的视觉监督,模型表现会很快饱和。

研究提出了两个互补的指标 GPG(白盒)和 ED(黑盒)来衡量 Caption 中与图像绑定的真实信息量。实验证明,这两个指标能高度预测扩散模型最终的训练损失。

基于此,团队提出 StructuredPrompt (SP),用结构化 JSON 格式将全局、元素和关系等视觉变量组织到命名字段中,显著提升了模型从文本中学习的能力。同时,通过引入 LLM Prompter 并结合三阶段训练,将用户简短请求转化为高质量 SP。最终系统在复杂组合、推理等任务上取得显著提升,证明了文生图的下一步 Scaling 不仅是扩大模型,更要扩展条件本身的信息量。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →