4DAnyone: Create Anyone in 4D from a Casual Monocular Video
Yudong Jin, Tao Xie, Qihang Zhang, Zehong Shen, Zhen Xu, Yujun Shen, Hujun Bao, Xiaowei Zhou, Yinghao Xu
cs.CV
2026-08-21
从一段未标定单目视频生成16路互洽新视角,再抬成4D高斯溅射。DNA-Rendering上重建PSNR 24.15,比同数据微调的ReCamMaster高3.6,不靠稠密深度。
4D高斯溅射(4DGS)能把动态人体渲成任意视角,但训练仍要标定好的多机位阵列。手机随手拍一段,相机内参和位姿都不知道,直接拟合4DGS会在遮挡面和背面穿帮。
另一条路是先用可控相机的视频扩散模型合成新视角,再拿这些视频去重建。现有模型在三四路视角上还能看,一扩到重建需要的十几路,跨视角外貌就开始漂。根因是单次DiT前向的注意力上下文有上限:目标视角必须分组去噪。参考侧把已生成视角全塞进去,长度按O(N)涨,外观提示被稀释;目标侧各组互不看见,全局结构慢慢错位。
4DAnyone建在Wan2.2-TI2V-5B上,走「先生成、再重建」。几何条件故意用稀疏但稳的信号:GVHMR从单目视频估三维骨架,再按目标相机渲成带z-buffer的骨架视频。近处肢体挡住远处,正面背面不再糊成同一张2D火柴人。关键点只留40个(身体、脚、手掌级),脸和细手指交给源视频去学,避免噪声关键点把生成带偏。
跨视角一致性靠两件互补设计。
训练分三阶段:先在DNA-Rendering前景上学骨架控相机,再放开背景学光影,最后加Pexels和TedTalk单目数据做野外泛化。自建的MVGameHuman提供24机位游戏引擎数据。损失是潜空间flow matching加λ=0.25的LPIPS。128张H20训约三天。生成视频用FreeTimeGS抬成4DGS。
测试是10个未见过的DNA-Rendering场景加3个分布外的DyMVHumans场景,单眼前视源视频生成16路均匀视角。
| 设定 | 方法 | DNA PSNR | DyMV PSNR |
| 生成视频一致性 | ReCamMaster(同数据微调) | 21.47 | 21.94 |
| 生成视频一致性 | 4DAnyone | 24.33 | 24.48 |
| 4DGS重建 | ReCamMaster | 20.55 | 19.86 |
| 4DGS重建 | 4DAnyone | 24.15 | 23.28 |
零样本的TrajectoryCrafter在DNA上4DGS重建只有14.81,正面转到背面经常塌。MV-Performer正面还行,侧面背面形体拧。消融里去掉RCP和TCR,一致性PSNR掉到21.09;两者都开、用滑动分组到22.63。随机分组几乎没增益,跨步分组还会变差,说明分组时得保住局部邻接。
这是一条能落地的单目到4D人体路径:不估稠密度量深度,也不要源相机参数。骨架比深度稳,RCP/TCR把「扩散模型一次看不了那么多视角」变成工程问题而不是原理死结。项目页和代码已公开。对做数字人、体积视频的人,这是可跟的生成辅助重建,不是再堆一层相机ControlNet。
代价也清楚:128卡三天、推理20步、每组四视角,不是消费级实时。ReCamMaster在同样RCP/TCR和数据上仍落后,说明骨架条件和打包策略不只是训料的功劳。
骨架管不住离身很远的飘逸衣料,跨视角布料会对不齐。HMR估错非常规姿态时,所有生成视角会一起跟着错:足尖站立被估成平脚,整圈新视角都是平脚。评测场景数量偏少(DNA 10条、DyMV 3条),野外结果主要靠展示。TrajectoryCrafter和MV-Performer是零样本,和同数据微调的ReCamMaster不对等,论文自己把后者标成公平对照。生成内容有深度伪造风险,作者要求标注合成并取得当事人同意。