三步去噪世界模型Evoke,单卡H200撑住两小时不间断生成

Alaya-EVOKE: From Linear-Scaling Supervision to Endless World

Yuanyang Yin, Gongxuan Wang, Yifan Zhan, Chuanhao Li, Kaipeng Zhang, Feng Zhao

cs.CV

2026-08-14

Evoke把场景记忆挪到外部几何库,教师模型专为长程监督设计,三步学生在单卡H200上撑住两小时不间断生成。

这篇在解决什么

交互式世界模型(根据用户操作实时生成视频的系统)要同时做到三件互相矛盾的事:记住之前发生过什么、对操作响应要快、还要能撑很长时间不崩。把历史存进denoiser的上下文或KV cache,成本会随会话时长线性增长,逼着开发者在记多久和跑多久之间二选一;而想要低延迟就得靠少步数生成,少步数模型的能力天花板又被它蒸馏时用的教师模型锁死。Evoke要解决的就是这个系统性矛盾:怎么让一个只需要三步去噪的低延迟模型,同时具备长时间不衰减、能记住之前场景、还能随时响应新指令的能力。

方法

Evoke把这个问题拆成两半分别解决。第一半是把持久化的场景状态从denoiser里搬出去,存进一个按相机位姿索引的外部世界状态库。每生成一个视频块(1.5秒),就用单目深度模型把画面反投影成三维点云存进库里;下次相机转回某个之前见过的位置,就直接从库里把对应视角渲染出来,当作像素级条件喂给生成器。这样denoiser每次处理的token数量始终是固定的,不会随会话时长增长,会话变长只增加调用次数,不增加单次调用的规模。

第二半是重新设计蒸馏用的教师模型。作者认为少步数学生模型继承的能力上限就是教师模型监督覆盖的范围,如果教师只在几秒的短窗口上打分,学生就学不到内容随时间缓慢漂移这类只有拉长时间跨度才能发现的错误。于是Evoke的教师模型用分块稀疏注意力(每块只看局部上下文、少量远处关键帧、加一个线性注意力压缩的全局状态),把长序列的计算量从平方增长压到线性增长,能负担得起对30秒长窗口整体打分。同一套分块结构还给每一段视频独立分配文本条件,让教师能在同一段训练序列里体验中途换指令这件事。最终用分布匹配蒸馏(distribution matching distillation)把这两种能力(长程稳定性和中途响应新指令的能力)一起转移给三步、不用classifier-free guidance的学生模型。

结果

在WBench导航测试集(158个场景,和所有对照系统条件完全相同)上,Evoke的视频质量、场景一致性、物理合理性三组指标均值都领先其余八个模型:

指标组Evoke最强对照
视频质量均值82.7981.77(HappyOyster)
场景设定均值83.7677.90(LingBot-World v2 fast)
物理合理性均值72.0669.05(HappyOyster)

VBench-2.0上Evoke拿下10个模型里的第一(66.77),VBench-Long上排第7(85.11,落后榜首IPOW的88.26),但Evoke只用三步无CFG采样,对照组大多用各自默认的多步采样器,不是同步数对比。长会话测试(8段65.5分钟连续生成,合计2619个视频块)显示画面色彩统计在初始过渡期后基本不再漂移,场景身份余弦相似度稳定在0.523,和真实视频隔60秒自比的水平相当。世界状态库的回访召回实验显示:保留窗口只要不短于离开的时长,PSNR就能比更短的保留窗口高2.3到3.2dB,最终稳定在15.4-17.8dB(属于认得出但不是像素级还原的水平)。中途换文本指令时,针对场景里还没被几何锚定的区域,67%的情况能成功引入新元素;但如果新指令要求覆盖已经被几何库锚定的内容,成功率只有4%。

为什么重要

对做交互式内容生成(游戏、具身智能仿真环境、长视频生成)的团队,这篇给出一个明确的架构分工原则:空间记忆该用显式几何结构处理(相机位姿一查就能找到之前观察过的内容),时间上的长程一致性该靠训练时的监督窗口去解决(靠模型自己学会不漂移),两者不能互相替代,延长监督窗口治不好记不住已经见过的地方这个问题,几何库也决定不了没观察过的内容该怎么自然演化。这个分工思路对任何想做长会话交互系统而不是单纯堆参数量的团队都有直接参考价值。工程上单卡H200每个1.5秒视频块只要2.11秒就能生成,意味着这套方案已经接近可用的实时交互延迟。

局限与存疑

论文自己列出三条尚未解决的问题:目前的几何世界状态库主要记的是粗粒度场景结构,物体身份、外观这类细粒度一致性还保持不住;世界状态库目前只存静态几何,不记录物体的运动状态和状态转变(比如一个正在变化中的过程),这类动态世界状态怎么持续更新还没做;真正做到实时交互还需要更快的VAE、更高效的少步生成器。此外,文中给出的长会话稳定性证据样本量是n=1(单次连续会话),论文自己也标注这是稳定性证据不是保真度证据,没有做多次重复实验来验证这个结论的稳健性。教师监督窗口长度和内容漂移改善之间的因果关系也没有完全厘清。论文测试后发现,把打分窗口拉长到超过某个阈值后,教师-评论家对漂移的可探测度并没有继续明显提升,说明长程教师带来的好处不能简单归结为打分窗口更长这一个变量。

术语

原文与代码

社区讨论

相关论文

全部论文解读