清华智谱CogVideoX:3D VAE加专家Transformer,开源十秒高清视频

CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, Da Yin, Yuxuan Zhang, Weihan Wang, Yean Cheng, Bin Xu, Xiaotao Gu, Yuxiao Dong, Jie Tang

cs.CV

2024-08-12

清华和智谱用3D因果VAE加专家Transformer训练CogVideoX并开源2B与5B权重,可生成10秒768×1360视频;5B在七项指标里拿下五项,人工评总分2.74高于当时Kling的2.17。

这篇在解决什么

Sora 把 Diffusion Transformer 视频生成推到台前之后,开源模型仍卡在短、动得少、对不住长提示。早期 CogVideo 走自回归 Transformer。后面一波扩散模型常用图像 2D VAE,再加时空分离注意力:空间压缩靠图像编码器,时间维另加一层。闪烁、大动作物体对不齐、文本和画面融不深,都从这里来。

清华和智谱把这条线收成 CogVideoX:3D 因果 VAE 同时压空间和时间,专家 Transformer 把文本和视频嵌进同一条序列,再配过滤加重写 caption 的数据管线。ICLR 2025 发表,2B 和 5B 权重、VAE、caption 模型一并开源。能出最长 10 秒、16 fps、768×1360 的连续视频。

方法

3D 因果 VAE 把像素压到 latent,压缩比 8×8×4(空间 8 倍、时间 4 倍)。卷积在时间上是因果的,padding 全放在序列开头,未来帧不影响当前。预训练用 16 通道的 variant B:相对 SDXL 的 2D VAE,相邻帧 L1 闪烁从 93.2 降到 86.3,PSNR 从 28.4 到 28.7。再往上压到 16×16×8,通道加到 128 也很难收敛。长视频在时间维做 context parallel,每个 rank 只把卷积核长度减 1 的那一段传给下一个 rank。

Expert Transformer 这边,T5 文本嵌入和 patch 后的视频 latent 在序列维拼接。两种模态数值尺度差很大,所以各用一套 Expert Adaptive LayerNorm,用扩散 timestep 做 modulation。注意力是 3D full attention,不做 2D 加 1D 的分离。论文给的理由很具体:分离注意力里,下一帧人物的头没法直接看到上一帧的头,信息只能绕背景 patch 暗传,大动作容易裂。5B 用 3D-RoPE,x/y/t 各占通道的 3/8、3/8、2/8;2B 仍用 sinusoidal。

训练把图像当单帧视频混进去。Multi-Resolution Frame Pack 把不同时长、不同分辨率塞进同一 batch,避免固定帧数把短片扔掉、把长片截断。分辨率从短边 256 进到 512、768。Explicit Uniform Sampling 把扩散 timestep 按 data parallel 的 rank 切成区间,每个 rank 只在自己的区间里采样,loss 抖得少。数据过滤后大约 3500 万条单镜片段,均长约 6 秒,外加 20 亿张美学过滤图。六个基于 Video-LLaMA 的分类器负责砍二次剪辑、低质、讲座、字幕墙、屏幕录像。caption 管线是 Panda70M 短句,加 CogVLM 逐帧密描述,再经 GPT-4 汇总,蒸馏到 LLaMA2,最后训出端到端的 CogVLM2-Caption。

2B 是 30 层、hidden 1920;5B 是 42 层、hidden 3072。扩散用 v-prediction 和 zero SNR。最后用大约 20% 的更高质量子集做微调,去字幕和水印。

结果

VAE 在 WebVid 验证集、256×256、17 帧上,闪烁 85.5、PSNR 29.1,好过 Open-Sora 的 92.4 / 28.5 和 Open-Sora-Plan 的 90.2 / 27.6。

生成质量按 VBench 里跟观感更一致的几项,外加 Dynamic Quality 和 GPT4o-MTScore:

模型人物动作场景动态程度多物体外观风格Dynamic QualityGPT4o-MT
LaVie-296.449.5931.1164.8825.09未报2.46
OpenSora V1.285.842.4747.2258.4123.8963.72.52
CogVideoX-2B96.655.3566.3957.6824.3757.73.09
CogVideoX-5B96.855.4462.2270.9524.4469.53.36

5B 在 7 项里拿了 5 项最高。场景 55.44,略低于 T2V-Turbo 的 55.58;外观风格低于 VideoCrafter-2.0 的 25.13。动态程度 2B 反而比 5B 高,66.39 对 62.22。

人工评跟 2024 年 7 月的 Kling 对:感官 0.722 对 0.638,指令遵循 0.495 对 0.367,物理 0.667 对 0.561,封面 0.712 对 0.668,总分 2.74 对 2.17。评分是 0 / 0.5 / 1 三档。

结构消融:同等参数下 Expert AdaLN 的 FVD 好过 MMDiT;2D+1D 早期 FVD 更高、训练更容易崩。H800、50 步推理,5B 在 480×720、6 秒要 113 秒和 26 GB;768×1360、5 秒要 500 秒和 76 GB。

为什么重要

这是 2024 到 2025 开源视频生成一条可复现的主线:3D VAE、3D 注意力、重写 caption,权重和配套模型都放出来了。想跟视频 DiT 的人,这篇的工程选择比排位更有用。大动作不要靠分离时空注意力硬传;文本和视觉不要共用一套 AdaLN;caption 质量可能比再改半层结构更值钱。

5B 在当时对人打 Kling 能赢。到现在这个对照已经过时,当历史坐标看。

局限与存疑

正文没有独立的局限节。高质量微调能去字幕水印,论文自己写语义能力会略降。3D full attention 在 768×1360 单步前向 9.60 秒,2D+1D 只要 4.17 秒,一致性是拿算力换的。训练数据是均长 6 秒的单镜切片,跨镜头叙事不是这套数据的强项。人工评只对了当时的 Kling,主文没写评委人数。外观风格和场景两项并没有全面领先。16 fps、最长 10 秒,规格放到今天已经普通。

术语

原文与代码

社区讨论

相关论文

全部论文解读