文本条件缩放研究:结构化提示提升视觉生成
shangbinfeng · x · 2026-08-04
- 这篇论文研究的是视觉生成里的文本条件控制如何随规模变化。作者发现:单纯把自然语言 prompt 写得更长,并不稳定地带来更多有效监督。
- 论文提出两个度量:GPG 和 ED,用来衡量 caption 中可被图像对齐的信息量;实验显示,收敛后的 diffusion loss 与这种“结构化语言”含量存在明显标度关系。
- 作者把生成质量拆成两部分:diffusability(表示能否把有用信息喂给扩散模型)和 promptability(LLM 能否把用户意图实例化成可生成的结构化提示)。
- 通过带语义/几何标注的结构化 prompt,以及经过 SFT、cold-start 和 verifier-gated on-policy distillation 训练的 prompter,系统在多数组合推理、常识与世界知识评测上优于开权重模型,并在不少项目上追平甚至超过闭源模型。
所属事件:研究称结构化提示词在视觉生成中遵循线性缩放规律(2 条相关)→
「多模态」频道最新
- MiniMax H3 被跑进 Mac,本地整夜生成视频成可能 — AIandDesign · 2026-08-04
- MiniMax H3 的 LoRA 训练仍难保住角色相似度 — Kitchen_Carpenter195 · 2026-08-04
- ComfyUI 实测 MiniMax H3:视频音频同步生成 — GamerVick · 2026-08-04
- 如何把参考视频传给 MiniMax H3 的原生节点 — RayHell666 · 2026-08-04
- MiniMax H3 首日支持本地部署,最低只需两张 RTX 5090 — yvbbrjdr · 2026-08-04
- AI 海滩广告梗图:巨型冰淇淋和避暑标语太离谱 — AyakonAIArt · 2026-08-04