无骨骼、31个潜在刚体:BLARM从单目视频驱动网格动画

BLARM: Animating 3D Objects from Video via Blending Latent Rigid Motion Primitives

Pradyumn Goyal, Yizhak Ben-Shabat, Hsueh-Ti Derek Liu, Haomiao Jiang, Snehasish Mukherjee, Kyle Spence, Mark Stauber, Evangelos Kalogerakis, Yunze Zeng

cs.CV

2026-09-01

Roblox与UMass提出BLARM,把网格动画压成31个随时间变的刚体变换加固定蒙皮权重,ActionBench上CD-3D从对照ActionMesh的3.30降到1.71,16帧推理只需3.13秒。

这篇在解决什么

静态3D生成已经能交出可用网格,给网格上动画仍卡在两条路上。一条路先从几何推断骨骼或笼子,结构跟当前视频里的具体运动对不上。另一条路直接回归每个顶点的位移,维度高、时间上容易抖,也很难塞进现有动画管线。

单目视频是最便宜的运动来源。没有骨骼标注、没有笼子、没有蒙皮权重,怎样把视频里的运动写到一张固定拓扑的网格上,还保持顶点对应、时间连贯、能编辑,这才是真问题。

方法

BLARM把运动拆成两块。一块随时间变:J个潜在刚体分量,每个分量每帧解码成一组SE(3)变换,第一个分量当全局根节点,其余在根坐标系里做局部运动。另一块不随时间变:每个顶点对非根分量的蒙皮权重,softmax保证非负且归一。最后用线性混合蒙皮(LBS)把局部变换混完,再乘上根变换。

这套表示站在骨骼和逐顶点位移中间。它比固定骨骼更贴当前视频,比逐顶点回归更低维、更好解释。实验里非根分量数取J=31最稳。

网络是前馈Transformer。冻结的TripoSG形状编码器把规范网格压成几何token,一组可学习query经交叉注意力收成J个形变潜变量。这些潜变量按时间广播后,每层做三件事:交叉注意力读该帧DINOv3特征、帧内空间自注意力协调各分量、按分量做时间自注意力。分解后复杂度是O(TJ²)+O(JT²),比全连接时空注意力便宜。蒙皮权重由顶点几何编码加冻结PartField语义特征,对时间平均后的运动潜变量做交叉注意力得到,训练时没有骨骼或蒙皮标注。

训练三项损失。轨迹重建用按误差加权的L1,逼模型把力花在动得大的区域。熵正则逼每个顶点只跟少数分量有关。运动对比损失用真实轨迹构造正负样本,让运动相似的顶点蒙皮相近。权重λrec=3、λent=0.001、λcon=0.3。训练数据来自Objaverse约1万条动画序列,评测对象已从训练集剔除。规范网格在主实验里用真值,野外集用Trellis2从首帧重建。

结果

ActionBench有128条16帧序列,Motion80有80条变长序列。对照是同样吃视频加规范网格、不需要预定义骨骼的ActionMesh、Mesh4D、Motion3-to-4。

方法ActionBench CD-3DCD-MotionFVD
Mesh4D2.579.24787.38
Motion3-to-42.4910.311270.80
ActionMesh3.3011.121126.90
BLARM1.717.15426.72

Motion80上CD-3D从最强基线Motion3-to-4的2.25降到1.93,FVD从735.57降到482.50。Consistent4D野外集没有真值网格,只报外观:BLARM的FVD是890.96,ActionMesh是1410.61,CLIP与Mesh4D打平在0.84。RTX 4080上16帧推理3.13秒,ActionMesh要350秒,Mesh4D要55.33秒。

消融说明对比损失最关键。去掉它之后潜变量塌成每个形状大约只用1个非根分量,CD-Motion从7.15升到12.90。直接预测顶点位移的对照是10.96,仍差一截。J=15容量不够,J=127分量碎,CD-Motion升到11.88。

为什么重要

对做4D资产和游戏管线的人,这篇给了一条不绑骨骼、还能前馈出可编辑网格动画的路。蒙皮权重可视化常常落在连贯运动区域上,像弯曲的鞋面或成组的羽毛,说明模型在没有骨骼监督时自己拆出了近似部件。3.13秒的速度也够交互预览。

它仍是渐进改进。输入还是要一张规范网格,运动被刚体混合约束,布料、流体这类强非刚体不在目标里。

局限与存疑

作者自己写了两条。蒙皮权重在外观相近、运动该分开的区域会分错,相邻部件被缠在一起。规范网格拓扑如果撑不住目标运动,形变会出伪影。

另外几处论文没钉死。训练和主评测用的是合成Objaverse渲染,野外只报了外观指标,几何误差未知。主实验用真值网格,野外才用重建,重建误差会灌进动画。LBS本身有体积损失,作者说可换成对偶四元数蒙皮,但没做对照。对比损失依赖真值轨迹,迁到没有网格真值的真实视频时这条监督会断。

术语

原文与代码

相关论文

全部论文解读