冻结的 3D 运动模型直接喂 2D 骨架:一个外挂编码器追平 3D 输入,真机上反而更强

A Plug-and-Play 2D Motion Interface for Real-World Motion Language Models

Kaname Yokoyama, Norimichi Ukita

ECCV 2026 (Oral Presentation

cs.CV

2026-08-17

丰田工大给 VQ-VAE 架构的运动语言模型外挂一个 2D 运动编码器,把 2D 骨架对齐到 3D 潜空间,原模型一字不改;运动描述任务与 3D 输入差距缩到 0.5% 以内,真机单目视频上带适配器的 2D 输入反超 3D 估计管线,计算量只有其零头(17.2 对 250.2 GFLOPs)。

这篇在解决什么

运动语言模型(MoLM)把人体运动离散成 token 喂给语言模型,做运动描述和生成。它们全部在 3D 运动数据(动捕、多视角重建)上训练,输入是 263 维的状态向量:关节位置、关节旋转、全局位移都在里面。真实部署里运动只能从单目视频估出来,而单目 3D 姿态估计既难又贵,估出来的质量和训练数据的高质量 3D 之间有肉眼可见的落差。

一个没人验证过的假设盘踞在这个领域:MoLM 的运动理解能力是不是真的依赖那些 3D 特有信息(深度、关节旋转)?如果 2D 骨架就够,部署成本会大幅下降。这篇就是来验证这个假设的,ECCV 2026 口头报告。

方法

做法简单到近乎朴素:训一个 2D 运动编码器,把 2D 运动映射进 MoLM 里 VQ-VAE 的连续潜空间,底座模型完全冻结、一字不改。训练只做一件事,让 2D 编码器的输出和 3D 编码器对同一段运动的潜特征做 L1 对齐。推理时 2D 特征过一遍原模型的 codebook 量化成离散 token,直接进语言模型。

2D 运动的构造:从 3D 数据重建 22 关节骨架,训练时随机旋转视角(偏航加俯仰)做增广,正交投影丢掉深度,只留 SMPL 和 COCO 格式共享的 13 个关节,拼成 68 维的逐帧特征(根速度、根高度、关节位置、朝向、速度)。单张 A100、3000 个 epoch 就训完,成本极低。

真机视频还有一层分布差:训练用正交投影,真实观测是透视投影加姿态估计噪声。补一个 real-video adapter,插在 2D 编码器前面,吃估计出的 2D 运动加各关节置信度。训练数据用 AMASS 动作渲染成随机视角视频、跑 2D 姿态估计器,造出「真值 3D + 带噪估计 2D」的伪实机配对。

结果

HumanML3D 运动描述任务,三个底座模型(TM2T、MotionGPT、MG-MotionLLM)上三种设置对比:

底座3D 输入2D 从零训练本文 2D 编码器
TM2T(R-Prec Top-1)0.4880.2790.485
MotionGPT(R-Prec Top-1)0.516因复现问题缺0.523
MG-MotionLLM(R-Prec Top-1)0.5830.4870.576

平均与 3D 输入的差距:TM2T -0.2%,MotionGPT +0.4%,MG-MotionLLM -2.8%;从零训练 2D 的差距是 -25.8% 到 -12.8%。细粒度描述任务(FineMotion)上序列级平均差距 -0.5%,片段级 -1.1%。

为什么差这么小:2D 和 3D 各自量化出的离散 token 序列 Top-1 一致率 44.8%(随机基线 0.2%,codebook 512),Top-3 达 67.1%;把 3D token 随机替换成 codebook 里 k 近邻(k=1 到 9)后描述性能几乎不掉(k=9 时 -1.4%),随机替换则崩掉 34.2%。邻近 token 语义相近,量化偏差不伤语言模型。

真机数据集(132 段视频、10 人模仿 HumanML3D 片段、单目 iPhone 拍摄)上是分水岭:估计 3D 输入(TRACE/WHAM)相对参考 3D 平均掉 34-51%,裸 2D 输入掉 18-47%,带适配器的 2D 输入掉 10-22%,TM2T 上甚至 +4.3%。计算成本一边倒:WHAM 每帧 250.2 GFLOPs,ViTPose(Base)加适配器 17.2 GFLOPs,差 14.5 倍。

为什么重要

给所有「3D 数据训练、2D 数据部署」的模态模型指了条明路:不重训底座、不蒸馏、一个外挂对齐编码器就能换输入表示。方法上的启示是潜空间对齐比端到端重训划算得多:从零训 2D 模型要重走整个训练流程还多掉十几个点,L1 对齐一个编码器就把差距压到个位数百分点。

更根本的一层:如果 2D 骨架能近似 MoLM 的运动表示,那这些模型的运动理解很大程度上落在视角不变的 2D 可观测结构上,3D 旋转和深度对「理解运动在干什么」贡献有限。对做动作识别、人机交互、视频理解应用的人,这意味着单目 2D 姿态估计这条便宜成熟的前端可以直接接上最先进的 MoLM。

局限与存疑

作者自列:适配器的校正过程会平滑运动序列,细粒度差异被抹掉,MotionGPT 和 MG-MotionLLM 这类能生成细粒度描述的新模型受影响更大(真机上仍掉 18-19%);失败案例里 S 形行走轨迹丢失、举起双手到脸边被描述成拍手这类过度泛化;数据集构建靠人模仿,模仿误差本身引入语义错配。

读下来的补充:结论的适用范围论文自己划得很清楚,「2D 够用」是在 2D 特征被显式对齐到 3D 潜空间的设定下观察到的,不能推广成「3D 信息一般没用」;运动生成方向完全没碰,只做了 motion-to-text,反方向(文本生成运动)天然需要 3D 输出;真机数据集 132 段视频规模小,且 86.4% 的视频-标注语义一致率意味着基准本身有一成多噪声;对齐编码器仍需成对的 3D-2D 数据(从 3D 投影得到),纯无 3D 标注的场景没覆盖。

术语

原文与代码

相关论文

全部论文解读