Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds
Nan Duan, Haoyang Huang, Weiyang Jin, Haoran Li, Yaowei Li, Yuming Li, Yijun Liu, Xin Lu, Xiaoxiao Ma, Yanwen Ma, Yaofeng Su, Yilang Sun, Haoyu Wang, Zeyue Xue, Songchun Zhang, Junhao Zhuang
cs.CV
2026-08-24
京东把可组合跨镜记忆写进 Echo-1.5,角色与人声能跨镜头保持;世界模型变体 WBench 平均 81.7,超过 HiDream 的 80.7。
现有视频生成模型大多困在固定时间窗里:角色换镜就换脸,人声换镜就换音色;交互式世界一旦靠自己生成的历史继续滚,画面会慢慢漂,键盘、游戏日志和网页视频里的导航信号也对不齐。京东 Joy Future Academy 的 JoyAI-Echo-1.5 把同一套音视频骨干拆成两个变体:长视频要跨镜头记住人和声,世界模型要把异构导航统一成可校准的 6 自由度相机轨迹。
只把模型做大不够。这篇要改的是记忆、几何控制和 rollout 训练。
长视频侧把跨镜记忆做成可组合条件。历史镜头各抽一帧当视觉记忆;整段音频先做语音分离再编码成人声记忆,避免背景音乐被当成说话人。当前镜头、历史记忆、用户预先给定的记忆用错开的 RoPE 坐标分区,互不抢时间轴。训练时随机开关记忆和首帧图像,同一套接口覆盖纯文本、首帧图像、记忆、记忆加图像四种组合。数据分两阶段:先用身份组里场景不相邻的镜头教记忆检索,再用高分辨率、少字幕、中文占比更高、带切镜描述的语料补画质和转场。
世界模型侧不跟具体控制器绑定。UE 渲染给真值位姿,内部游戏给动作日志,人类实玩和网页视频用 ViPE 从约一分钟连续片段估度量纲 6-DoF 轨迹。相对平移再按训练集 90 分位最大位移做全局尺度校准,经 UCPE 注入视觉注意力。训练分三阶段:先学音视频先验,再冻结骨干只训相机通路,最后联合微调。
两端都要把双向多步骨干改成可流式的因果少步生成器。先用 teacher forcing 在干净历史块上做因果初始化,再用短程和长程 Self-Gradient Forcing,让后续块的损失能回传到「自己生成的历史怎么写进 KV」。长视频蒸馏走 8 步 DMD:视频全量微调、音频走 LoRA,外加 RMS 能量约束和音频对抗头,防止少步蒸馏把声音磨糊或越训越响。
长视频评测用 100 个故事、3000 个镜头。JoyAI-Echo-1.5 在七项里拿了六项第一。
| 方法 | ViCLIP | Self-CIDS | Voice | Speech Recall |
| JoyAI-Echo-1.0 | 0.8026 | 0.7793 | 0.8129 | 0.9489 |
| LTX-2.5 | 0.7775 | 0.6640 | 0.7603 | 0.9545 |
| JoyAI-Echo-1.5 | 0.8264 | 0.7937 | 0.8524 | 0.9674 |
人评对比 HappyOyster Directing:音画同步 48.4% 对 20.3% 更偏好 Echo,故事指令跟随 38.6% 对 17.7%。身份一致性 59.5% 判为相近,有差别时 Echo 以 24.8% 对 15.7% 略胜。
世界模型在 WBench Navigation 158 条上,未蒸馏双向多步版平均 81.7 第一,蒸馏四步因果版 81.0 第二,HiDream-O1-World 80.7。SANA-WM-Bench 官方 961 帧(16 FPS 下 60 秒)简单轨迹上,未蒸馏版旋转误差 3.22°,SANA-WM 是 7.59°;困难轨迹上旋转误差 12.05°,SANA-WM 更低,为 10.02°。视觉质量两边都是 Echo 更高。
要做可续写的叙事视频或可操作的世界模型,这篇给出一套能落地的拆分:记忆管身份,几何管控制,rollout 训练管漂移。代码已开源。8 步蒸馏和 4 步因果版说明少步不等于必须牺牲交互分数。它是系统工程论文,不是接到开源 DiT 上就能用的现成模块。
作者承认,困难长轨迹上旋转误差会累积。Hard 分裂上未蒸馏版旋转误差 12.05°,比 SANA-WM 的 10.02° 差。人评对 HappyOyster 时语义跟随和运动质量还输给对方。长视频自动指标里审美分只排第二。说话人记忆依赖语音分离质量,分离失败会把噪声写进后续镜头。长视频评测启用了 Director Agent 做镜头规划和记忆选择,表 2 的数字不是纯生成器裸跑。世界模型训练数据大量来自游戏引擎,开放世界的物理因果仍弱:WBench Physical 70.6,低于 HiDream 的 72.1。