揭示视觉生成新规律:结构化提示词遵循线性 Scaling Law
Zilong Chen · hf · 2026-08-03
本研究探索了视觉生成中文本条件(Text Conditioning)的实证缩放属性。研究者惊讶地发现,收敛后的扩散模型 Loss 并不随自然语言提示词的 Token 数量而变化,而是与提示词中的结构化语言含量呈规律性缩放。
核心要点:
- 量化指标:使用白盒似然指标(GPG)和黑盒属性指标(ED)来量化结构化语言。
- 缩放规律:收敛 Loss 与 GPG 呈近似线性关系,与 ED 遵循幂律关系。
- 系统优化:基于上述发现,通过带有语义和几何注释的图像构建结构化提示词来提升「可扩散性」,并通过监督微调、冷启动和验证器门控策略蒸馏训练出一个 Prompter。
最终系统在几乎所有组合、推理和世界知识基准测试中,均优于当时所有受评估的开源模型,并在多数评测中匹敌或超越最强的闭源模型。
「多模态」频道最新
- Seedance 视频模型实测:矢量风格图形清晰连贯 — bennash · 2026-08-03
- MiniMax H3 获 lmsysorg Day 0 支持,可本地部署于双卡 5090 — ying11231 · 2026-08-03
- 实测 Claude 自定义 Skill:输入网址一键生成产品宣传视频 — Scobleizer · 2026-08-03
- MiniMax 发布 H3 模型:原生支持 2K 音视频生成 — Mobile-Pumpkin7944 · 2026-08-03
- ComfyUI首发支持MiniMax视频模型,显存暴降66%可跑RTX 3060 — crystal_alpine · 2026-08-03
- MiniMax-H3 视频生成模型权重已上线 — blahblahsnahdah · 2026-08-03