用 VL 模型分析 19 帧镜头清单,模板化生成多镜头视频提示词
kim_deadja4951 · reddit · 2026-09-29
作者展示了一条从「已审校的镜头清单」到多镜头视频生成提示词的完整工作流:
- 用 Ling-3.0-flash-VL(经 OpenRouter)读取一个 38 秒剪辑中每 2 秒采样的 19 帧,输出 JSON,包含时间区间、景别、主体/动作、场景/光线、镜头运动与转场。
- 人工对照原片校对镜头顺序与边界后,把 JSON 字段填入一个固定模板:Sequence(总时长+镜头数)、全序列需保持的主体身份/场景/色彩光线/道具一致性,以及每个 Shot 的 Framing/Action/Camera/Transition 字段。
- 修改时只改具体字段(如替换 Shot 2 的动作但保留时长与景别),即可在下次生成前检查提示词级的变化。
「编程与Agent」频道最新
- 开发者因 Entra ID 认证太折腾,做出 MCP 托管平台 foro — Danielloesoe · 2026-09-29
- 给《晨风》NPC 装上 Jev:强盗会逃跑,目击者选择沉默 — sidahuj · 2026-09-29
- 把记忆当上下文而非权威:风控系统里 Hindsight 的窄职责设计 — joshita_09 · 2026-09-29
- shadcn 谈 AI 编码工具为何用横向标签:纵向是导航,横向是工作集 — xkonjin · 2026-09-29
- DeployMind 把部署复盘反馈变成可召回的反思记忆 — Key-Relationship545 · 2026-09-29
- 一条命令生成《兔子简史》:Opus 5.5 加 Runway MCP 一次成片 — tlakomy · 2026-09-29