ATGS 用时间锚点一次重建 1400 帧快动作体视频

ATGS: Anchored Temporal Gaussian Splatting for Long Volumetric Video Representation

Jiahao Wu, Jie Liang, Die Hu, Jiayu Yang, Kaiqiang Xiong, Xiang Li, Xiaoyun Zheng, Chao Wang, Ronggang Wang

SIGGRAPH'2026)

cs.CV

2026-08-31

北大与鹏城实验室提出 ATGS,用时间条件锚点和宽度 7 的窗口约束 Gaussian 生成,一次训练重建 1400 帧快动作体视频,VRU Long 上 PSNR 24.78,高于 LocalDyGS 的 23.21。

这篇在解决什么

体视频要把多机位 2D 录像变成任意视角、任意时刻都能看的动态三维场景。现有 3D Gaussian Splatting 和 4D Gaussian 路线卡在两个互相打架的需求上:分钟级、上千帧的长序列,以及大位移、多人、光照变化的快动作。

LongVolCap 能做分钟级,快动作就糊。FreeTimeGS、LocalDyGS 能跟复杂运动,窗口却只有一两秒。把长视频切成短 clip 再拼,接缝会闪。根子上,让单个 Gaussian 去跟踪很长一段复杂轨迹,优化很容易漂。

方法

ATGS 的判断很具体:别让点自己跑长途。给场景一串带时间戳的锚点,只在锚点附近生成 Gaussian。

时间条件锚点从关键帧稀疏初始化。每个锚点带 3D 位置、64 维特征 fa、空间尺度 v、关键帧编号 k。锚点负责管 Gaussian 的出现和消失,不再显式拟合点轨迹。

查询时刻 t 时,只激活最近关键帧左右各半窗的锚点,默认窗口 W=7。远处时刻不参与,长序列被拆成一串局部任务。

解码前再叠三层特征。fa 管局部细节,各锚点独立优化。fs 从共享的 128³×64 空间网格三线性查出,提供时间不变的局部一致性,避免锚点各训各的、画面抖。ft 来自按时间切段的 4D hash grid:室内小动作 M=2 段,VRU 球场大动作 M=12 段,查询只用当前段里的局部时间。

解码器把特征拼成 [fa+fs; ft],过两层 MLP,吐出该时刻的位置、姿态、尺度、不透明度和颜色。选择拼接而不是相加,是为了让静态分量和动态分量分开优化;论文写相加会让训练大约慢 10%。损失是 L1 加 SSIM(权重 0.2),外加权重 0.001 的体积正则,把 Gaussian 压在锚点附近。

小运动场景 N3DV、MeetRoom 用 K=15 个关键帧。球场 VRU 拉到 K=250。训练在 A100 80GB 上完成。

结果

主战场是 VRU 篮球:36 机位,GZ 和 DG 各 250 帧,Long 是约 1 分钟、1400 帧的 4K 快动作。LocalDyGS 一类方法通常只训约 20 帧;ATGS 一次训完整段。

方法VRU GZ PSNRVRU Long PSNR
4DGaussian(短段)28.3223.01
LocalDyGS(长段)29.2323.21
ATGS(长段)30.6124.78

VRU Long 上比 LocalDyGS 高 1.57 dB,比 4DGaussian 高 1.77 dB。GZ 上 30.61,已经贴近按帧独立训练的 3DGS(30.50),SSIM 0.948 对 0.949。

N3DV 300 帧上 ATGS 的 PSNR 是 32.56,LocalDyGS 32.28,SpaceTimeGS 32.05。渲染 70 FPS,训练 0.9 小时,慢于 LocalDyGS 的 105 FPS / 0.58 小时,但一次能覆盖 1200 帧(约 40 秒),对照方法多停在 300 帧。稀疏视角的 MeetRoom 上 PSNR 32.79,比 3DGStream 的 30.79 高 2.0 dB,模型 110 MB。SelfCap Bar 的 2000 帧上是 29.13,对 4DGaussian 的 27.86。

消融把零件钉死了。VRU Long 上去掉时间窗口,PSNR 从 24.42 掉到 24.02。去掉锚点特征 fa、只留 fs+ft,直接掉到 22.58。时间网格从 M=1 加到 12,GZ 上 PSNR 从 29.10 升到 30.61。特征可视化显示 fa 加 fs 几乎编码了全部场景内容,ft 主要在控制 Gaussian 的显隐,并没有在学一套完整的动态几何。

为什么重要

体视频工程上一直在「短而难」和「长而简单」之间选边。ATGS 给出一个可复述的配方:关键帧锚点、固定窗口、静态网格和动态 hash 拆开。对已经在用 Scaffold-GS 或 LocalDyGS 的人,这是同一套锚点解码思路的时间化,不是另起炉灶。

能用的场景很具体:多机位室内对话、球场、几分钟的手机阵列自拍。一次训完上千帧,省掉切 clip 再对齐的后处理。渲染端在 VRU-GZ 上全链路 15.6 ms(特征 0.7、MLP 5.9、光栅化 4.4),播是实时的。采集和训练仍是离线。

N3DV 这种小动作基准上只比 LocalDyGS 高 0.28 dB。增益主要发生在长序列快动作。业务如果只有 300 帧室内对话,这是渐进改进;如果要一分钟球场,差距才看得见。

局限与存疑

论文自己写了三条。整条管线是离线重建,不支持实时采集处理。位姿和稀疏点云仍靠 COLMAP,这是 3DGS 族的通病。VRU 看台上那种观测极稀的区域会有轻微时间抖动,因为多视约束不够,动态主体占的像素也很少。

对照也不齐。Table 3 里 3DGS、4DGaussian、SpacetimeGS 标了短段训练(20 帧或单帧),ATGS 和 LocalDyGS 才是长段。短段 3DGS 在 GZ 上的 PSNR 几乎追平 ATGS,说明「拉长」本身有代价。ATGS 的贡献是在长段上少掉分,不是在短段上碾压。SelfVolCap 和 FreeTimeGS 当时没有公开实现,表里没有它们。PKU-DyMVHumans 只说做了泛化实验,数字放在补充视频,正文没有。

超参也跟着场景走:小运动 K=15、M=2,大运动 K=250、M=12。换新场景还得手调关键帧密度和时间网格段数,论文没有给出自动选择规则。

术语

原文与代码

社区讨论

相关论文

全部论文解读