文本条件缩放研究:结构化提示提升视觉生成
shangbinfeng · x · 2026-08-04
- 这篇论文研究的是视觉生成里的文本条件控制如何随规模变化。作者发现:单纯把自然语言 prompt 写得更长,并不稳定地带来更多有效监督。
- 论文提出两个度量:GPG 和 ED,用来衡量 caption 中可被图像对齐的信息量;实验显示,收敛后的 diffusion loss 与这种“结构化语言”含量存在明显标度关系。
- 作者把生成质量拆成两部分:diffusability(表示能否把有用信息喂给扩散模型)和 promptability(LLM 能否把用户意图实例化成可生成的结构化提示)。
- 通过带语义/几何标注的结构化 prompt,以及经过 SFT、cold-start 和 verifier-gated on-policy distillation 训练的 prompter,系统在多数组合推理、常识与世界知识评测上优于开权重模型,并在不少项目上追平甚至超过闭源模型。
所属事件:研究称结构化提示词在视觉生成中遵循线性缩放规律(2 条相关)→
「多模态」频道最新
- Freya 发布 Adam/Eve 语音模型,称已跨越恐怖谷 — ycombinator · 2026-09-22
- Reddit 求实测:开源 LongCat-Video 生成 10 秒视频各 GPU 要多久 — Clean_Extreme_3970 · 2026-09-22
- 北邮研究揭示视频扩散模型违反物理的根源:RoPE 注意力衰减锁死轨迹 — BUPT-CIST · 2026-09-22
- 腾讯 ARC 发布 WorldCrafter:隐式 3D 记忆让视频世界模型分钟级探索保持一致 — TencentARC · 2026-09-22
- Grok 4.7 在 Blender 里搞出创作,一段演示引发围观 — iamfakhrealam · 2026-09-22
- Kyutai 发布语音原生推理模型 Voice of Reason,GSM8K 达 77.1% — alexcovo_eth · 2026-09-22