浙大BeyondPixels:跳过RGB,视频latent直接转4D动态场景

新智元 · wechat · 2026-08-19

ReLER/CCAI/浙江大学的 BeyondPixels 提出 Latent-to-4D:不再把视频模型生成的 latent 解码成 RGB 再用独立模型重建,而是通过 L4AR 网络把最终去噪 latent 直接翻译成 4D latent,输出可换视角观察的动态 4D 场景,避开跨表示的信息损失与误差传播。关键观察是:不同视频 DiT 只要共享同一套 VAE 规范(WanVAE),其最终 latent 就处于同一表示空间,因此文本、图像、姿态、轨迹等条件可沿同一接口进入 4D。训练无需运行视频 DiT,仅用约 1K 条已有重建视频,同一个 checkpoint 即可原样接入 Wan2.1-14B/1.3B 与 Wan2.2-I2V 三种 DiT,无需重训。评测上,same-latent 对比中 Image-to-4D 全指标第一,50 人人类评估中几何完整度偏好率达 66.8%72.1%。论文也明确边界:需 shared-VAE 才能换源,指标不等于度量级 4D 精度,机器人案例仅验证接口兼容而非物理正确性。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →