高斯不动、只改透明度,TOM-GS 把视频重建变成可直接编辑的三维资产

TOM-GS: Editable Video Representation via Temporal Opacity Modulation of Static 3D Gaussians

Marek Lisowski, Łukasz Smoliński, Kornel Howil, Piotr Biliński, Marcin Mazur, Przemysław Spurek

cs.CV

2026-07-22

TOM-GS 让 3D 高斯保持静止、只通过可学习的时间透明度建模运动,在 DAVIS 上画质领先,且是标准 3DGS 资产可直接编辑。

这篇在解决什么

把一段单目视频变成一个能编辑的三维表示,这件事一直卡在一个矛盾上。隐式神经表示(INR)是黑盒,没法动手改。动态 3D 高斯泼溅(3DGS)这条路要么用形变场让高斯随时间移动,要么用 VeGaS 那种「折叠高斯」专门分布来描述非线性运动。这些做法能跟上复杂运动,但它们都不是标准的 3DGS 几何,现成的三维编辑软件和物理引擎根本接不上。表达能力和可编辑性,过去只能选一个。TOM-GS 选了可编辑性。

方法

核心决定是让几何完全静止。TOM-GS 用的是最普通的 3D 高斯,位置、旋转、缩放、颜色都钉在一个统一的世界坐标里,从头到尾不动。

那运动怎么来?靠透明度随时间变化。每个高斯配一个可学习的时间均值和时间尺度,它的不透明度随时间走一条高斯曲线:该出现的时候淡入,该消失的时候淡出。物体看起来在移动,其实是沿轨迹排布的一串静态高斯在不同时刻依次点亮。整个场景就是一个静态点云,只是每个点有自己亮起的时间窗。

几个配套设计都为保住静态几何服务:

编辑流程是把高斯云转成四面体网格(沿用 GaMeS 的转换),在四面体上做编辑(手动缩放、复制、删除,或者丢进 Blender 跑软体物理仿真),再转回高斯。

这么做的代价是表达力:运动只能靠透明度明灭来近似,没法表达真实的轨迹形变。

结果

在 DAVIS 视频基准上,TOM-GS 在可编辑类方法里画质领先。

方法平均 PSNR平均 SSIM
TOM-GS36.500.98
VeGaS33.310.94
Splatter-a-Video28.440.84

视频级指标上 PSNR 达到 39.80,SSIM 0.98,高于 GaussianVideo、VeGaS 等一众对手(LPIPS 0.030 略逊于 GaussianVideo 的 0.021)。和神经表示类方法(NeRV 家族)比,平均 PSNR 35.06 也明显领先 VeGaS 的 32.42。

消融把方法拆得很清楚:去掉时间透明度(纯静态 3DGS)只剩 24.36,说明时间透明度就是这套方法的全部;换成神经网络的透明度预测器只有 29.19,显式给每个高斯一个时间窗更管用。效率上平均 851 万个高斯,训练 90 分钟,渲染 63.4 FPS。

为什么重要

这是第一个既画质领先、又是一个标准 3DGS 资产的可编辑视频表示。因为几何没有形变,它就是一份普通的三维高斯,可以直接拖进 Blender 这类工具做缩放、删除,或者跑软体物理仿真。之前的可编辑方法要么打不进工具链,要么画质跟不上。对做三维视频编辑和物理仿真的人来说,拿到的不再是只能看的重建,而是能上手改的资产。

局限与存疑

作者承认两点。一是长视频和突变场景重建吃力:每个高斯只有一个时间窗,表示不了一个点先出现、再消失、又重新出现的情形。二是高斯数量会涨(论文封顶 1000 万),视频越长,显存和推理开销越大。再加上它高度依赖 AnyCam 的位姿质量,前景编辑还被简化成单层几何。1000 万的封顶本身也是在画质和显存之间妥协,放开还能再涨。

术语

原文与代码

社区讨论

相关论文

全部论文解读