阿里7B联合音视频开源,一步蒸馏出2K精修器

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang, Bingze Song, Jiachen Lei, Ruimin Lin, Jiahong Wu, Xiangxiang Chu

cs.CV, cs.SD

2026-09-01

阿里开源7B原生联合音视频生成器,后半层用门控跨模态注意力对齐音画,再蒸馏出一步2K精修器。Verse-Bench上DeSync优于多数开源基线,音频美学仍落后大模型。

这篇在解决什么

多数视频生成器要么不带声音,要么先出画面再配音。嘴型、撞击声、环境声和镜头运动其实是同时发生的,分两段做会切断这种互为因果的关系。联合生成已经有开源系统,但公开可下载、能出2K、骨干还压在十亿级参数的组合几乎没有。LTX-2.3是22B,MOVA是32B激活18B,MAGI-2 Preview是114B激活6B。DreamX-Creator 1.0把这条线压到7B,并放出可本地跑的2K精修器。

方法

生成器吃第一帧加文本提示,对音频、视频两路latent做flow matching联合去噪。网络前半段两路各自走,后半段才打开成对的音频到视频、视频到音频交叉注意力。两路token速率不同,所以先映射到同一套时间坐标,再给跨模态的Q/K加时间RoPE,不必重采样任何一路。

交叉注意力的输出会过一个token级、head级的sigmoid门,门同时看目标token隐状态和注意力输出。方向掩码决定这一条样本走A2V、V2A还是Joint;门只缩放已经打开的那条路径。A2V/V2A训练时目标流更噪、条件流更干净,并对条件骨干的K/V停梯度,避免目标损失把条件骨干带偏。

数据侧按场景切clip,用Q-Align、Audiobox Aesthetics、Synchformer、SyncNet分层过滤,再用Qwen3-Omni联合标注。训练数据里说话占45.0%,事件声占33.4%。训练分三阶段:后半段LoRA预热、全参联合预训练、高质量微调。随后用模态感知的多模态反馈做强化学习:视频优势进视频流,音频优势进音频流,同步项两边都吃。2K精修先训双向多步教师,再改成自回归多步,最后用DMD蒸馏成每个时间块只做一次去噪的学生,音频在这一步不动。

结果

在Verse-Bench上,7B基座对开源研究基线够用,对更大开源系统则有取有舍。

方法参数VQ↑LSE-C↑DeSync↓
NAVA6.3B0.61167.72610.2342
Ovi10B0.65427.30950.4730
Ours7B0.65687.80180.1902
Ours (RL)7B0.65737.83610.1351
Ours (Refiner)7B0.69307.69790.1731
LTX-2.322B0.62857.67680.2412
MiniMax-H333B0.64298.73540.2708

RL把DeSync从0.1902压到0.1351,精修把VQ抬到0.6930,同步会略回退。对人侧,对Ovi、UniAVGen、NAVA、DaVinci的视频质量胜率在61.7%到73.7%;对Wan2.7、Kling v3、MiniMax-H3则音质和音画对齐都是负的。

为什么重要

这是目前公开权重里最小的原生联合音视频骨干,本地就能出2K。做音视频联合建模、同步奖励或视频超分蒸馏的人可以直接拿7B当底座,不必先对接一个托管API。它没有在音频美学和跨模态语义上超过22B/33B开源系统,定位是可复现的研究底座,不是全面第一。

局限与存疑

7B在Content Enjoyment、Content Usefulness、Production Quality和ImageBind上落后LTX-2.3和MiniMax-H3,唇形同步也落后MiniMax-H3的8.7354。用户研究里高动态、构图复杂的场景样本不足。精修会把DeSync从0.1351抬到0.1731,高分辨率和同步并没有一起变好。RL只在1000个「第一帧+提示」对上做,规模偏小。结论段还把RL和2K精修写成「带验证要求的设计」,和正文已报的数字不完全对齐,读的时候以评测表为准。

术语

原文与代码

相关论文

全部论文解读