字节Seed研究:Caption信息量比长度更能预测文生图质量
机器之心 · wechat · 2026-08-12
ByteDance Seed 团队最新研究发现,在文生图模型中,单纯增加自然语言 Caption 的长度并不能带来更多有效的视觉监督,模型表现会很快饱和。
研究提出了两个互补的指标 GPG(白盒)和 ED(黑盒)来衡量 Caption 中与图像绑定的真实信息量。实验证明,这两个指标能高度预测扩散模型最终的训练损失。
基于此,团队提出 StructuredPrompt (SP),用结构化 JSON 格式将全局、元素和关系等视觉变量组织到命名字段中,显著提升了模型从文本中学习的能力。同时,通过引入 LLM Prompter 并结合三阶段训练,将用户简短请求转化为高质量 SP。最终系统在复杂组合、推理等任务上取得显著提升,证明了文生图的下一步 Scaling 不仅是扩大模型,更要扩展条件本身的信息量。
「多模态」频道最新
- 开源 MiniMax H3 优化套件:显存占用直降 25% — Fantastic-Equal-1696 · 2026-08-12
- MiniMax H3 Turbo LoRA 发布:768p 4 步生成 — jugernaut126 · 2026-08-12
- 通义万相 3.0 登陆 OpenArt,支持 12 种语言原生文字渲染 — Alibaba_Qwen · 2026-08-12
- 跳过阿里云配置:通过聚合 API 调用 Wan 3.0 实战指南 — Practical_Low29 · 2026-08-12
- PROJECTIFY 插件:在 Blender 中用 ComfyUI 生成 3D 模型 — AccordingInspector58 · 2026-08-12
- Ex-Omni-2D:具备原生视觉表现力的全模态对话模型 — Haoyu Zhang · 2026-08-12