Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models
Yuanhao Ban, Jiaqi Feng, Hengguang Zhou, Xiaohuan Pei, Justin Cui, Cho-Jui Hsieh
cs.CV, cs.AI
2026-08-20
流式视频的刚体三维奖励会把画面冻住。Stream4D改用前馈四维重建加运动门,LongLive上4D-PSNR从17.44升到24.20,人工相对World-R1胜76%。
流式自回归扩散按块吐帧,能拉长视频、也能接近实时,训练目标却只保证局部下一帧,不保证场景在几何和运动上自洽。滚得越长,尺度漂移、深度关系乱掉、动作发僵。World-R1、VideoGPA用刚体3D高斯溅射当奖励:真实物体运动会被当成重建误差罚掉,最高分策略是把场景冻住、只留相机动。自回归更吃这个捷径,前一块一旦静止,后面块接着抄同一套刚体配置,奖励照拿。
Stream4D把批评器换成前馈4D高斯溅射。先用StreamVGGT估每帧相机,再用MoVieS把候选视频建成「规范点云 + 逐帧形变/外观」。重建奖励是重渲染帧与原帧的LPIPS,clip到[0,1]:能被连贯的动态场景解释就高,物体身份漂、几何对不上就低。4D重建本身不罚运动,低运动片段仍稍好重建(Spearman ρ=-0.27),所以另加运动项。
运动强度m取动态掩膜上置信加权的三维场景流速度,高斯门g(m)以基座模型运动中位数为峰值,过静和过猛都扣分。平滑项罚速度突变,刚性项罚邻域速度撕裂。三者相乘:Rmot = g(m)·smooth·rigid。再加HPSv2做帧级观感锚,避免几何项把画面审美带跑。三轴在组内做z-score后加权相加,优势用DiffusionNFT的前向过程损失更新,LoRA打在冻住的蒸馏骨干上。
三条骨干:Self-Forcing和Causal-Forcing约5秒(81帧),LongLive 10.3秒(165帧)。测试是VidProM里500条高运动提示。MoVieS 4D-PSNR:Self-Forcing 16.88→20.34,Causal-Forcing 15.44→20.97,LongLive 17.44→24.20(+6.76 dB)。换结构、权重、数据都不同的4DGT复核,仍分别比World-R1高约0.7 / 1.1 / 2.5 dB。盲序Gemini-3.5-Flash一致性胜率82.2% / 73.9% / 74.2%,World-R1是75.9% / 69.1% / 54.0%。运动分0.83 / 0.77 / 0.71。VideoReward相对基座总胜率66.2% / 76.0% / 84.4%。
LongLive上50条高运动提示、150对盲测:相对World-R1整体胜76%,相对VideoGPA 80%。相对基座,原始运动胜率只有43%(基座更猛、更飘),整体仍60%。去掉运动项,PSNR可以更高,运动分崩到0.34 / 0.45 / 0.42;去掉重建项,运动拉满、一致性垮。高斯门目标mnat=0.020,0.010太静、0.030太糊,正好落在折中点。
几何奖励如果不能表达动态,策略就会靠冻帧刷分。4D重建加峰值运动门把「能解释的运动」和「胡乱抖动」拆开,而且同一套配方迁到三条蒸馏AR骨干上。做世界模型、交互视频、要长rollout还要物体真的在动,这条比继续堆静态3D一致性更对症。它仍是奖励蒸馏,不是新的生成器结构。
附录写了:一致性裁判来自单一视觉LLM,虽然VideoReward和4D指标方向一致;4DGT排除了对MoVieS训练偏置的依赖,却仍共享VGGT相机组件。结论里下一步是流式4D重建器,去对齐LongLive的原生时长,以及按动作/相机条件打分。人工评测只有50条提示、5名标注。训练提示来自VidProM,150 epoch LoRA,没报对非运动提示是否伤画质(附录另有随机500条)。重建PSNR高也不等于度量几何精确。