Visual prompt engineering for video models
Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer, Neha Kalibhat, Zi Wang, Mani Malek, Oyvind Tafjord, Kevin Swersky, Been Kim, Priyank Jaini
cs.CV, cs.AI
2026-07-28
DeepMind 发现,用图像编辑模型把视频推理任务的输入图从抽象草图改成照片级真实,模型表现系统性提升;在 Veo 3.1 上一个物理任务从 41.3% 提到 59.3%,比改文字 prompt 或测试时多次采样更有效。
文本 prompt 工程早就成了提升语言模型表现的标配手法。现在视频生成模型正变成视觉推理的基础模型(能解迷宫、做逻辑题、模拟物理),它们同时吃一个文字 prompt 和一个「视觉 prompt」(通常就是生成视频的第一帧图片)。奇怪的是,文字输入被反复研究怎么优化,视觉输入却被当成固定的、不能动的。这篇要补的就是这个缺口:能不能像优化文字 prompt 那样,靠改这张任务图来提升视频模型的推理?
作者把这个想法叫 visual prompt engineering(VIPE),流程分三步:
自动化有两种模式:一种是 freeform ideation,让 VLM(Gemini 3.1 Pro)自由提点子、开环执行;另一种是 ACE(Atomic Concept Editing),一次只改一个概念,按树状搜索探索,并根据自动评分闭环迭代。
在一个叫 VPCT 的物理推理任务(预测球滚下来落进哪个桶)上,把草图改成照片级真实,各模型都涨:Veo 3.1 从 41.3% 涨到 59.3%,Omni Flash 从 56.3% 涨到 67.5%,Wan2.2 从接近随机涨到显著高于随机。一个关键对照:测试时多次采样投票(self-consistency)只能把 Veo 3.1 从 41.3% 顶到 50.0%(20 次),而 VIPE 单次就到 59.3%,两者叠加能到 68.0%。而一次 VIPE 变体只花一次视频生成的八分之一成本。在六个任务、18160 段视频的大规模测试里,有的任务变体把错误率降了 75% 以上,ACE 在「排序三个数字」上做到 100% 错误率下降。和文字 prompt 工程正面比,「排序三个数字」从 4% 涨到 86%(文字变体)和 76%(图像变体),图像变体在多个任务上平均涨得更多。
这篇的洞察对评测和实用都有影响。对评测,它点破了一件事:视频模型有「真实偏置」(realism bias),在抽象、合成的任务上表现差,不代表它真没这能力,可能只是被带出了分布外,现有那些看起来抽象的草图基准大概率低估了模型。作者的解释是,视频模型主要在真实视频上训练,喂它抽象草图等于逼它在陌生地盘推理,场景一致性崩溃(物体随机出现、消失、变形),推理自然就错;每往真实方向走一步,生成一致性就涨一档(人工评的场景一致性从合成的 0% 涨到完全真实的 59%)。对实用,VIPE 是一个便宜(八分之一视频成本)、即插即用的测试时提分手段。
作者自己说最大的局限是:变体质量高度依赖图像编辑模型,如果编辑器改动了任务性质或引入伪影,下游视频模型就没法解原任务了,他们靠 Filter 这一步兜底,未来编辑模型更靠谱后这步可能不再需要。还有一些值得追问的:VIPE 目前主要在结构化、可清晰描述的推理任务上验证,对开放、模糊的真实视觉任务效果如何不清楚;「真实偏置」本身是不该有的捷径(理想模型该能解任何形式的任务),把它当工具用是权宜,长期看是训练分布的缺陷。此外自动化 VIPE 依赖 Gemini 和 Nano Banana 这一栈,结论的可复现性绑死在这些闭源模型上。