编码成知识图谱、解码回视频,AVA-Encoder让agent学会读电影

AVA-Encoder: Towards Agent-Native Video Representation Learning

Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang, Bingnan Li, Shuqi Gu, Kan Ren, Jiaming Liu, Ruihua Hua

cs.CV, cs.CL

2026-08-13

AVA-Encoder把电影编码成文字知识图谱再用固定解码器重建,靠重建误差自我进化,整体准确率49.0%,超最强基线20.7个百分点。

这篇在解决什么

视频创作 agent 已经能写故事、设计关键帧、生成视频片段,但离拍出能上映的完整影片还差得远,核心原因是基座模型缺乏协调剧本、角色、镜头、视听元素这些复杂决策的规划能力。要学会这种规划能力,理论上最好的老师是海量专业电影里蕴含的编剧、角色设计、运镜、节奏、视听配合的知识,但人类导演能反复研读的这些电影,agent 却拿不到手:电影这种紧密编织的多模态内容,和 agent 习惯操作的结构化表示(文本、代码、图)之间存在根本性的错配。像素、隐向量这类底层视觉表示信息量足,但 agent 读不懂也改不动;字幕这类纯文本描述 agent 能读,却把电影压成一条线性叙述,丢掉了实体关系、事件组织、跨模态依赖这些结构;已有的视频知识图谱大多是给检索、问答这类理解任务设计的,只存稀疏语义事实,重建不出足够细节去真正「拍」出对应的镜头。

方法

论文提出一套电影创作知识图谱表示:Story-Event-Shot 三层叙事结构,加上挂在每个 Shot 下面的 Character、Scene、Object、Style、Camera、Audio 六类状态节点,全部存结构化文本;生成的关键帧图片、音频、视频只放在单独的资产层里,用带类型的边把文本节点和资产关联起来,一条边坏了整条链路都能顺着修。围绕这套表示,AVA-Encoder 是一个自进化的编码-解码框架:

结果

在 ground-truth 锚定的重建基准上,AVA-Encoder 整体重建准确率 49.0%,比最强外部基线 soap2soap 的 28.3% 高出 20.7 个百分点,在直接视频比对、直接关键帧比对、视频回描述、关键帧回描述四个方向上全面领先(分别领先 21.1、34.2、13.9、11.6 个百分点)。消融实验拆解了增益来源:三层递进理解比单层理解高 18.3 个百分点(27.5 → 45.8,相对提升 66.5%);在关掉内循环、只比拼编码策略的受控条件下,伪训练出的策略(45.8)反超人工调优的策略(44.4),而且用的 system prompt 只有 8,052 个 token,比人工版本的 31,336 个少 74.3%;两个循环各自单独都有增益,叠加起来一共比两个都不用高 6.6 个百分点(相对提升 15.6%);去掉防退化/防遗忘门之后准确率从 49.0 掉到 43.5,说明这两道门真的在拦住会让指标倒退的更新,不是可有可无的保险。知识图谱的可编辑性也做了展示:改一个角色的注册信息,LLM 能顺着图的依赖关系自动找到并更新所有相关镜头的外貌、动作、台词,同时不动无关角色和场景。把生成的知识图谱原样喂给四个已有的下游视频生成框架(MovieAgent、FilmAgent、Anim-Director、VideoStudio)当参考文本,不做任何针对性适配,四个框架的生成质量全部提升。

为什么重要

这篇论文的核心贡献不是又做出一个更好的视频生成模型,而是提出了一种可以复用的「电影翻译成文本」的中间表示:只要有了这份知识图谱,agent 就能读懂一部电影讲了什么、怎么拍的,也能像编辑文档一样去改它,不用整段重新生成。对创作类 agent 来说,这意味着专业电影第一次有可能变成可学习、可检索、可复用的训练素材,不再只是一段人看得懂、机器读不懂的像素流。固定解码器、把重建误差当优化信号这个设计也提供了一种衡量「表示保留了多少信息」的具体方法,不用像下游任务评测那样绕一圈才能间接判断表示好不好。

局限与存疑

论文没有单独列局限章节,但从设计里能看出边界:重建质量高度依赖固定解码器(文本生图 + 图生视频)本身的能力,知识图谱写得再准,解码器生不出对应画面,重建分数照样上不去,论文没有讨论换一套更强或更弱的解码器会怎样影响结论。评测的 18 个视频里既有动画、AI 短片也有经典电影,但样本规模不算大,伪训练只用了 6 条视频,论文没有展示更大规模数据下的表现是否会有质的变化。用 VLM 做事实问答式判分虽然比直接打分更细粒度,但判分模型本身的偏差(比如对某些视觉细节系统性地看走眼)会直接传导进重建奖励和最终评测里,论文用了「双向呈现顺序一致才算通过」的一致性校验,但没有单独量化判分模型本身的误差率。

术语

原文与代码

相关论文

全部论文解读