文本条件缩放研究:结构化提示提升视觉生成
shangbinfeng · x · 2026-08-04
- 这篇论文研究的是视觉生成里的文本条件控制如何随规模变化。作者发现:单纯把自然语言 prompt 写得更长,并不稳定地带来更多有效监督。
- 论文提出两个度量:GPG 和 ED,用来衡量 caption 中可被图像对齐的信息量;实验显示,收敛后的 diffusion loss 与这种“结构化语言”含量存在明显标度关系。
- 作者把生成质量拆成两部分:diffusability(表示能否把有用信息喂给扩散模型)和 promptability(LLM 能否把用户意图实例化成可生成的结构化提示)。
- 通过带语义/几何标注的结构化 prompt,以及经过 SFT、cold-start 和 verifier-gated on-policy distillation 训练的 prompter,系统在多数组合推理、常识与世界知识评测上优于开权重模型,并在不少项目上追平甚至超过闭源模型。
所属事件:研究称结构化提示词在视觉生成中遵循线性缩放规律(2 条相关)→
「多模态」频道最新
- Kyutai 发布语音原生推理模型 Voice of Reason,GSM8K 达 77.1% — alexcovo_eth · 2026-09-22
- 24G 内存 MacBook 跑 Qwen-Image 本地生图:一张要 5-6 分钟 — vista8 · 2026-09-22
- 腾讯混元发布 Hy Image3.5 preview:人工评测胜率提升 30%,单图 $0.024 — TencentHunyuan · 2026-09-22
- 三段 5 秒 AI 角色短片:实测动作、身份一致性与遮挡 — Agentvideobot · 2026-09-22
- SoundBoost 推出音乐视频生成器,一键产出完整 MV 素材包 — TheChuckTone · 2026-09-22
- eidoverse 世界搬进 Unreal:胸灯投射实时阴影效果惊艳 — repligate · 2026-09-22