ShotPlan 用可学习规划 token 做多镜头电影感视频生成
Tele-AI · hf · 2026-07-21
论文要点
ShotPlan 解决的是电影感视频生成中的一个核心难题:单镜头视频生成已经不错,但要做出有叙事结构、镜头切换清晰的多镜头视频,还需要显式规划。
- 方法引入了 可学习的 planning tokens,用于编码镜头级别的过渡线索。
- 这些 planning tokens 会和原始视频生成 tokens 结合,用来控制镜头切换的时间点。
- 作者进一步设计了 FRoPE(Fractional Temporal Rotary Position Embedding),让镜头过渡可以在帧级别建模。
结果
论文称 ShotPlan 在电影感视频生成任务上优于已有方法,主要体现在:
- 镜头管理更灵活
- 镜头之间的一致性更强
一句话说,就是把视频生成从“连续吐一段视频”推进到“按镜头组织的导演式生成”。
「多模态」频道最新
- Reddit 分享了一支 AI 生成短片《The Lunar Ship》 — Ermajean12 · 2026-07-21
- AI 创作者 GossipGoblin 正在把短视频做成长片 — Hackedv12 · 2026-07-21
- TimeLens2 以 4B 和 8B 模型拿下 7 项视频定位 SOTA — _akhaliq · 2026-07-21
- AI 制作的 4 分钟恐怖短片成了可转发名场面 — gen_ericai · 2026-07-21
- 多款前沿大模型生成红色法拉利 SVG 效果横评 — Able-Line2683 · 2026-07-21
- 给 VLM 加顺序元数据后,错误检测会崩掉 — m_wulfmeier · 2026-07-21