揭示视觉生成新规律:结构化提示词遵循线性 Scaling Law
Zilong Chen · hf · 2026-08-03
本研究探索了视觉生成中文本条件(Text Conditioning)的实证缩放属性。研究者惊讶地发现,收敛后的扩散模型 Loss 并不随自然语言提示词的 Token 数量而变化,而是与提示词中的结构化语言含量呈规律性缩放。
核心要点:
- 量化指标:使用白盒似然指标(GPG)和黑盒属性指标(ED)来量化结构化语言。
- 缩放规律:收敛 Loss 与 GPG 呈近似线性关系,与 ED 遵循幂律关系。
- 系统优化:基于上述发现,通过带有语义和几何注释的图像构建结构化提示词来提升「可扩散性」,并通过监督微调、冷启动和验证器门控策略蒸馏训练出一个 Prompter。
最终系统在几乎所有组合、推理和世界知识基准测试中,均优于当时所有受评估的开源模型,并在多数评测中匹敌或超越最强的闭源模型。
所属事件:研究称结构化提示词在视觉生成中遵循线性缩放规律(2 条相关)→
「多模态」频道最新
- AI 生图「博物馆雕像被调包」梗图走红,作者附上 prompt — umesh_ai · 2026-09-22
- 普林斯顿 VideoGen-Agent:多任务智能体 RL 调工具,视频生成提 19 分 — princetonu · 2026-09-22
- Intel 为 Qwen-Image-2.1 提供首日 OpenVINO 优化支持 — Alibaba_Qwen · 2026-09-22
- Pexo 实测:对话式操作做出 30 秒 SpaceX 概念品牌大片 — SimplyAnnisa · 2026-09-22
- H3 Motion Context 节点实测翻车:片段开头闪烁、烧掉积分 — superdeathkillers · 2026-09-22
- 用 6 年前的 CLIP 做零标注图搜:2.5 万图检索小于 50ms — jason_mayes · 2026-09-22