GPT-5.2、Gemini 3 都判不准的儿童步态,这篇用 RGB 视频做到 84%

Decoding Children's Gait Behavior

Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg

ECCV 2026

cs.CV

2026-08-01

作者发布 110 人、1185 段 60FPS 的儿童步态数据集 CGV,并提 ChildGait-Video 做到 84% 准确率,而 GPT-5.2、Gemini 3 零样本几乎瞎猜。

这篇在解决什么

步态分析对诊断和治疗儿童发育与神经肌肉疾病很关键,脑瘫、偏瘫都靠它。现有方案要用 3D 传感器,贵、侵入性强,对小孩不实用。而基于计算机视觉的步态模型几乎都在成人数据上预训练,针对的是成熟、稳定、高度周期性的成人步态;儿童的步态熵更高、类内方差大、模式不稳定,这些模型直接迁移过来效果很差。

这篇把「从普通 RGB 视频做儿童步态的细粒度分析」立成一个新的视觉问题域,临床目标是爱丁堡视觉步态评分(EVGS),每条腿 17 个评分项。为了支撑研究,作者发布了 Children Gait Video(CGV)数据集。

方法

ChildGait-Video 是个端到端模型,主干用 VideoMAE v2,直接把视觉特征映射到 EVGS 评分项。两个关键设计:

作者刻意不走传统几何路线(提姿态 → 算几何 → 规则打分),理由是它丢掉了丰富的外观和纹理信息,而且把关节角度孤立评估,忽略了关节之间的运动协同。模型后面接一个 MLP 头直接预测 EVGS 各项。

数据集 CGV:110 名儿童患者(2.6–16.6 岁,均值 8.4),1,185 段视频,共 339,236 帧,1920×1080、60 FPS,矢状面和冠状面两个视角,每次做 5 秒「绕场行走」任务。每条腿 17 个 EVGS 项,每名患者共 34 项。诊断覆盖脑瘫、脑外伤、髋关节发育不良、足尖行走等。因类别不平衡,把中度/重度合并,做成正常 vs 异常的二分类。

结果

方法左腿 17 项准确率右腿 17 项准确率
GaitSet / GaitPart / GaitGL / GaitBase48%51%
BiggerGait(此前 SOTA 步态模型)54%53%
VideoMAE v269%72%
ChildGait-Video84%84%

ChildGait-Video 的 F1 为 0.83,34 个评分项的单项准确率在 70%93% 之间。McNemar 检验相对 VideoMAE v2 给出 p = 2.3×10⁻⁴,提升统计显著。人类专家的一致性基线是 93.8% 准确率、ICC = 0.93。

前沿 VLM 的成绩更能说明问题:零样本下 Gemini 3 Pro 53%/55%、GPT-5.2 53%/56%、Qwen3-VL-235B 54%/59%,基本压在二分类的随机线附近;微调过的 Qwen3-VL-ChildGait 也只涨 12 个百分点。帧数消融里,8 帧(0.26 秒)74.1%,16 帧 87.0%,32 帧 90.7%,说明临床步态评估需要足够长的时序上下文。

为什么重要

这篇的主要贡献是问题定义和数据集。它用实测数据指出一个被忽视的事实:即便是最前沿的多模态大模型,在做「从视频判读细微的生物力学偏差」这种任务时也接近瞎猜,它们偏语义理解,不擅长定量生物力学解读。专门的步态识别网络(为身份识别设计)同样不行。一个加了简单先验的端到端视频模型就能把它们甩开一大截。临床上的潜在回报是用一台普通摄像头替代昂贵的 3D 步态系统,做儿童步态筛查。

局限与存疑

年龄越小越难:≤8 岁组 82.4%,≥8 岁组 85.2%,说明发育中的运动模式更难刻画。论文目前只做了模型层面的验证,数据来自医院采集,还没在家庭、康复中心、社区这种开放场景验证泛化。从成人数据预训练带来的领域 gap 也还在。更根本的是,VLM 在这类细粒度动作识别上的短板,这篇指出了但没解决。

术语

原文与代码

相关论文

全部论文解读