用 VL 模型三问审查视频生成:运动、主体、背景分开校验更精准
professr_dumbledore · reddit · 2026-10-03
作者给出一个用视觉语言模型审查 AI 生成视频的具体流程,以 Cosmos3-Edge 生成、Ling 3.0 VL 抽六帧比对预期运动为例。
- 示例序列含两条生成指令:先「爬升后右移」,再 Take B 改为「0–5 秒悬停、5–10 秒右漂」,最后一次复核针对 Take B,用固定坐标的青色辅助线对比首尾帧。
- 核心方法论:把图像到视频的审查拆成三个独立问题——
- 运动:按同一参照轴,主体在首尾帧各在哪?
- 主体:哪些识别性细节在各采样帧仍可见?
- 背景:背景地标在各帧之间如何对齐?
- 分开提问的好处是下一轮 prompt 修改可以很具体:方向问题对应路径,主体问题对应外观,背景问题对应场景。
「多模态」频道最新
- PDMD 4-NFE LoRA 上架 Hugging Face:MiniMax-H3 视频蒸馏开源发布 — linoy_tsaban · 2026-10-04
- 两步蒸馏的 PDMD H3 LoRA 实测:整体惊艳,特写与语音仍逊 Turbo — linoy_tsaban · 2026-10-04
- 「Vibe町」生成日式室内场景,连无人提示的艺术工作室都自己冒出来 — Merzmensch · 2026-10-04
- AI 生成分层 RGBA 素材交付,设计师接手改稿工作流探讨 — tinkerbellyie · 2026-10-04
- 网友用 AI 复刻 Asmongold 进魔兽世界,自己玩上了 — djcows · 2026-10-04
- 第一视角变身齐天大圣,AI 视频名场面引热议 — lucky-plume · 2026-10-04