HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark
Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan, Yintianrun Zhang, Xuchuan Chen, Sikai Liang, Zekai Li, Chenghuai Lin, Xinqiang Yu, Wenyao Zhang, He Wang, Li Yi
ECCV 2026
cs.RO, cs.AI, cs.CV
2026-08-14
153 小时专业动捕分四族评人形机器人跟踪,并用 12K 对专家偏好训出 HumanScore,偏好对齐率 0.91 远超 MPJPE 的 0.80。
让机器人跟踪一段参考动作,是人形控制的核心能力,遥操作和全身模仿都建立在它上面。评这个能力的尺子却很粗糙:主流做法是报告关节角度误差(MPJPE 一类),把逐帧姿态差平均掉。低误差不等于好看,脚在地面滑行、落地时机踩错、支撑腿抖动这些一眼假的物理伪影,逐帧平均根本看不见。常用的 AMASS 测试集只有 140 条序列,长尾动作覆盖不足,结果还常常压成一个总分,看不出在哪类动作上崩。
这篇 ECCV 2026 论文(南开、清华、Galbot 等联合)同时换数据和换尺子:153 小时的分类目动捕基准,加上一个按人类偏好训练的打分模型 HumanScore。
数据侧,24 名专业演员(舞蹈老师、健身教练、网球教练、全职动捕演员)在多相机光学动捕棚完成约 153 小时动作,经 GMR 重定向到 29 自由度人形机器人,人工剔除穿地、悬空、接触断裂的段落,得到 25K 条片段。按失败模式分四族:日常 89 小时、高动态 11 小时、交互 48 小时、贴地 5 小时,每条带文本描述。评测协议统一 MuJoCo 入口、统一 qpos 表示、50Hz 记录,终止判据沿用 SONIC 的全身标准:骨盆、双踝、双腕垂直误差超 0.25 米或骨盆旋转误差超 1 弧度即判失败。各 tracker 保留自己的观测与动作接口。
HumanScore 是重点。四个现有 tracker 在训练集动作上跑 rollout,切成 5 秒窗口,按全局索引均匀采样配成对;6 位人形机器人方向的博士生看同步视频二选一(或判相似、无法比较),共 12K 对、24K 条轨迹。打分模型是时间 Transformer:每帧 539 维特征(70 维参考状态加 469 维仿真状态、控制、实测接触动力学、根运动),严格偏好对用 Bradley–Terry 损失,相似对施加对称约束。推理时按窗口打分,sigmoid 映射到 0–100,按帧数加权平均。
两个设计选择很关键。模型直接吃仿真轨迹而非渲染视频,规避相机视角依赖,打分也可复现;特征里包含实测接触力,这在贴地类动作上被证明是决定性的。
四个 tracker 零样本评测(都没在 HumanTracker 上训练),Succ 为完成率(%),HumanScore 满分 100:
| 方法 | 日常 Succ/HS | 高动态 Succ/HS | 交互 Succ/HS | 贴地 Succ/HS |
| GMT | 17.0 / 2.4 | 36.2 / 7.0 | 81.4 / 11.7 | 0.0 / 4.0 |
| TWIST2 | 60.1 / 10.1 | 39.9 / 16.9 | 91.3 / 28.3 | 0.0 / 4.5 |
| SONIC | 93.8 / 49.5 | 82.1 / 41.0 | 97.6 / 54.6 | 20.1 / 26.5 |
| Humanoid-GPT | 94.4 / 54.7 | 86.9 / 49.2 | 97.2 / 56.8 | 32.9 / 24.9 |
Humanoid-GPT 综合最强,日常和高动态三项指标全领先;SONIC 在交互族完成率最高、贴地族 HumanScore 最高,贴地动作更稳更自然。贴地族全员挣扎,最好的完成率也只有 32.9%,低重心多接触是共同短板。
度量对齐方面,HumanScore 与人类偏好一致率 0.908,高于所有解析式指标:关节速度误差 0.840、关键点误差 0.841、MPJPE 0.805、脚接触一致率 0.788、关节加速度 0.693。消融显示去掉接触特征,贴地族对齐率从 0.879 掉到 0.759;加未来参考信息反而略降;可用时序上下文从 1 秒拉到 4 秒,对齐率从约 0.86 升到 0.91,脚滑、抖动这类随时间展开的伪影需要足够长的窗口才看得见。
对做 tracker 的人,这个基准把单一总分拆成四族可诊断的失败模式,贴地和高动态的短板有明确数字。HumanScore 可以直接当训练奖励用,论文也把它列为后续方向;偏好数据构建流程(多 tracker rollout 均匀配对、专家标注、防显示位置偏置、按源动作分组切分)可复用到其他机器人评测。
对更大范围的具身智能工作,这是把「人类觉得哪个更好」引入机器人评测的完整样板,不用人工设计规则去枚举伪影。
偏好数据只来自四个 tracker 的 rollout 分布,新 tracker 的行为超出这个分布时打分是否还准,论文没有验证。打分模型吃仿真轨迹特征,好处是摆脱渲染依赖,代价是与人类「看视频」的判断之间隔着一层特征工程,539 维特征是否覆盖人类在意的全部线索未知。评测只在一个 29 自由度机器人形态上做,跨形态泛化是作者自列的后续工作。四族体量悬殊(日常 89 小时对贴地 5 小时),作者按自然频率解释并分族报告,但贴地族样本量相对小,该族结论的置信度也相对低。