JHU 开源 GenCine:单图生成视频,3D 控制相机与物体运动
anand_bhattad · x · 2026-10-03
Johns Hopkins 团队(Jiahan Zhang 一作,Alan Yuille、Anand Bhattad 参与)发布 Generative Cinematographer(GenCine),论文 arXiv:2610.02180。
- 问题:现有可控视频生成多用 2D 轨迹或拖拽信号,当相机与物体同时运动时,同一 2D 轨迹对应多种 3D 运动,控制存在歧义。
- 方法:将单张图像提升为可编辑的 3D 场景(点云),创作者在 Blender 等工具中同时编排相机路径与前景物体运动(局部 3D 运动手柄,多刚体区域独立移动来近似非刚体运动,无需物理模拟器);再把控制投影为对应图(XYZ 世界坐标 + 身份图),经冻结的 Wan VAE 编码,通过侧分支与 LoRA 适配器注入预训练视频扩散模型,仅训练轻量分支。
- 意义:「3D Vision is dead, long live 3D Vision!」——作者认为这类 3D 合成控制不止用于电影摄影,还可生成机器人训练数据、探索物体运动与相机视角。
所属事件:JHU 开源 GenCine:单图生成视频并 3D 控制运动(3 条相关)→
「多模态」频道最新
- fal 上线 MiniMax H3 Max Recast:参考图换掉视频中人物,保留动作与音轨,每秒 0.3 美元起 — lmoroney · 2026-10-03
- Qwen-Image-2.1-viggle-turbo 在 ComfyUI 快速生成角色设定图 — RiverSide71h · 2026-10-03
- ComfyUI 演示 QI 2.1 的 AI 图像相机控制 — RobbaW · 2026-10-03
- GenCine 对比现有运动控制方法:3D 控制可指挥机器人手臂 — anand_bhattad · 2026-10-03
- Minimax H3 适配器实现“正确”的手绘关键帧动画 — leelweenee · 2026-10-03
- Ben Affleck 称拒绝用版权数据训练的 AI,前 OpenAI 高管质疑 — Miles_Brundage · 2026-10-03