Camera Artist: A Multi-Agent Framework for Cinematic Language Storytelling Video Generation
Haobo Hu, Qi Mao, Yuanhang Li, Libiao Jin
cs.AI
2026-04-10
中国传媒大学和北大提出多Agent拍片框架Camera Artist,用递归分镜加580对镜头语言LoRA调度MAGREF,用户脚本一致性4.28、动态程度80,压过MovieAgent与VGoT。
现在的 Text-to-Video 和 Image-to-Video 模型,短片可以很好看,但默认是片段思维:一镜漂亮,接起来不像电影。MovieAgent、Anim-Director、VideoGen-of-Thought 这类多 Agent 系统已经能从剧本走到成片,把导演、编剧、摄影拆给不同的大模型。卡住的地方有两处。镜头描述常常直接从场景生成,不怎么看上一镜,相邻镜头会漂,角色和场景说换就换。通用模型写提示词时也很少动用专业镜头语言,景别、机位、运镜、光效写得像说明书。
中国传媒大学联合北京大学给出 Camera Artist,专门补「镜头怎么接」和「每个镜头该怎么拍」。
三层 Agent,两段流水线:先建素材,再出镜头。
Director Agent 用 Qwen3-30B-A3B,按思维链把用户大纲扩成剧本、场景和角色设定,再用 Flux 出角色和场景参考图。
核心在 Cinematography Shot Agent。Recursive Shot Generation 按场景递归写分镜。第一镜只看当前场景和总剧本;中间镜必须以上一镜为条件;模型自己判断何时写到场景终点。每个镜头必须串在上一镜后面写,不能对同一段剧情平行各写一版。Cinematic Language Injection 再用 LoRA 微调过的 Qwen3-4B,把普通镜头描述改写成带景别、机位、运镜、光效的电影句。微调数据只有 580 对,来自 ShotBench:先让视觉语言模型写不含镜头意图的普通描述,再用 GPT-4o 把 ShotBench 的镜头标注合进去当目标。LoRA rank 8,扩放系数 32,学 20 个 epoch。
Video Generation Agent 用 MAGREF 做多参考 Image-to-Video,按镜头描述和参考图逐镜生成 832×480、15 fps 的片段,再拼接成长片。也可以不给参考图,只从文字大纲走完全流程。
评测在 MoviePrompts 上做,那是 10 部专业电影抽出来的剧情和角色档案,外加 8 个同样格式的自建故事。
| 方法 | CLIP-T | 主体一致 | 背景一致 | 运动平滑 | 动态程度 | 美学 |
| VGoT | 28.15 | 78.58 | 97.93 | 99.27 | 16.67 | 68.73 |
| Anim-Director | 23.86 | 67.79 | 94.15 | 96.54 | 39.78 | 67.24 |
| MovieAgent | 22.25 | 71.01 | 94.52 | 98.00 | 76.27 | 65.63 |
| Camera Artist | 29.61 | 79.54 | 96.26 | 99.32 | 80.00 | 69.51 |
VGoT 背景一致性最高,动态程度只有 16.67,接近静图。Camera Artist 动态 80.00,CLIP-T 和美学分同时最高。
GPT-4o、Qwen3、Gemini-3 三个视觉语言模型打 1 到 5 分,平均下来脚本一致性 3.90(最好基线 2.98),运镜一致性 3.55(最好基线 2.30),画质 4.71,像电影程度 4.02。真人五级量表上,脚本一致性 4.28,像电影程度 4.12。论文没报有多少人打分。
消融很干净。去掉递归分镜,脚本一致性从 3.90 掉到 3.55,定性上会出现主角突然换人。去掉镜头语言注入,运镜一致性从 3.55 掉到 2.83,画面变静、只剩陈述性内容。
对想做 AI 短片或分镜系统的人,这篇把「像电影」拆成两个可插拔模块:跨镜头条件生成,和镜头语言改写。生成器本身是现成的 MAGREF 和 Flux,贡献在调度层。580 对 LoRA 就能把运镜分拉开,说明镜头语言这件事目前更接近提示词工程加小微调,不是再训一个视频模型。
这是编排层的渐进改进。画质天花板仍是底层 Image-to-Video。
论文没有单独写局限。评测只有 10 加 8 个故事,定性例子大量用冰雪奇缘、疯狂动物城这类版权角色。用户研究没报人数。三个评委模型里有 Qwen3,Agent 骨干也是 Qwen3,同源偏好没法排除。递归只发生在场景内部,场景之间怎么接没有建模。成片是片段拼接,不是一次生成长视频。CLI 只用 580 对、4B 模型、rank 8,换到非好莱坞镜头语法有多大把握,正文没测。代码和权重未在正文承诺开源。