ShotPlan 用可学习规划 token 做多镜头电影感视频生成
Tele-AI · hf · 2026-07-21
论文要点
ShotPlan 解决的是电影感视频生成中的一个核心难题:单镜头视频生成已经不错,但要做出有叙事结构、镜头切换清晰的多镜头视频,还需要显式规划。
- 方法引入了 可学习的 planning tokens,用于编码镜头级别的过渡线索。
- 这些 planning tokens 会和原始视频生成 tokens 结合,用来控制镜头切换的时间点。
- 作者进一步设计了 FRoPE(Fractional Temporal Rotary Position Embedding),让镜头过渡可以在帧级别建模。
结果
论文称 ShotPlan 在电影感视频生成任务上优于已有方法,主要体现在:
- 镜头管理更灵活
- 镜头之间的一致性更强
一句话说,就是把视频生成从“连续吐一段视频”推进到“按镜头组织的导演式生成”。
「多模态」频道最新
- FastH3-Live 升至 22fps:加速节点实测与 ComfyUI 显存避坑 — spartong945 · 2026-09-11
- Midjourney 风格参考分享:--sref 2912175708 — tisch_eins · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Hailuo 转推:MiniMax H3 MAX 一发生成 15 秒美食动画短片 — Hailuo_AI · 2026-09-11
- MiniMax Music 制作工具包 2.5 发布,新增完整母带处理链 — Vivid_Promise1700 · 2026-09-11
- ComfyUI 新节点发现器上线:按 star 增速过滤最新热门节点 — Luke2642 · 2026-09-11