Does Imitation Learning Preserve Temporal Robustness in Dexterous Manipulation? An Expert-Learner Comparison Across Task Execution Speeds
Clinton Enwerem, John S. Baras, Calin Belta
cs.RO, cs.LG
2026-09-01
马里兰大学在 ParcelStow 上对比脚本专家和 ACT:名义速度都是 100%,速度加倍后专家 84%、ACT 53%。47 次失败里 35 次是插入对不齐;没有力闭合的 414 次抓取全部失败。
模仿学习的鲁棒性评估通常改场景、物体或指令,很少改任务执行速度。接触丰富的操作里,加快执行会改速度、加速度、跟踪负担和接触瞬态,成功率会跟着变。学习者在名义速度上追上专家,不等于它继承了专家对速度的依赖。已有工作多半评估「比示范更快」的外推,这篇要的是在示范速度范围内、同一组初始条件下,专家和学习者的成功率差多少。
基准叫 ParcelStow:固定基座的人形机器人抓起包裹、在空中调姿态、插入容器。脚本专家和从它的示范里训出的 ACT、Diffusion Policy、DAgger 在同一任务几何、同一成功标准和同一组初始条件抽取下评。示范覆盖抓取之后各阶段的加速因子。名义速度 r=1,示范范围到 r=2,再外推到 r=3。每格 100 个回合。成功看插入后包裹是否竖直落在 10° 公差内。
失败诊断分三层。阶段闩锁看回合死在抓取、调姿、插入的哪一步。相对运动交接:从学习者的抓取姿态起,改用专家的手–包裹相对运动走完后续,用来排除「空中把包裹弄丢了」。力闭合在抓取瞬间用物理阈值 ε≤0,无拟合参数,作为下游成功的候选必要条件。
专家和 ACT-A 在 r=1 都是 100/100。r=1.5 时 99 对 91。r=2 时 84 对 53,Wilson 区间分别是 [0.76, 0.90] 和 [0.43, 0.63],配对自助法给成功率差的 95% 区间是 [0.18, 0.44]。从 r=1 到 r=2,专家掉 16 个百分点,ACT-A 掉 47。另外两个随机种子的 ACT 名义成功率只有 0.70 和 0.62,同一区间仍掉 34 和 48 个点,都比专家的 16 个点大。Diffusion Policy 在三档速度上是 0.68、0.73、0.54,不单调。DAgger 全程贴着地板,最高 3/100,没法谈速度敏感性。
示范从 50 条加到 100 再到 297,名义成功率 0.27→0.44→1.00,r=2 时却是 0.46、0.44、0.53,区间重叠。多数据修好了名义表现,没修好快速度。
ACT-A 在 r=2 的 47 次失败里,35 次是插入对不齐,10 次插入卡住,1 次滑动过大,1 次超时。相对运动交接后,ACT-A 的每次抓取都能在空中保住包裹,但整体任务完成率只有 64%,专家抓取接同一套运动是 95%。没有力闭合的 414 次抓取,跨策略跨速度全部失败,Wilson 上界 0.009。ACT-A/B/C 无闭合抓取分别占 8%、21%、34%。连续接触裕度的判别力一般,留出 AUROC 在抓取时只有 0.62。
名义成功率不能当模仿学习的验收标准,至少在接触丰富、速度会变的操作里不能。ACT 的动作块预测加时间集成,和专家逐步出指令不是同一类控制器,这篇没有扫块长度,所以还不能把锅扣在 chunking 上。能说的是:要测时间鲁棒性,就得在示范速度范围内把专家和学习者放在同一组初始条件上比,而不是只报一条名义准确率。力闭合是这里的成功必要条件,但不是充分条件。
对要部署灵巧操作的人,这意味着评测表要加一列执行速度,并且插入阶段的对准误差值得单独盯。
单一任务、状态观测、固定摩擦仿真、固定基座人形,没有真机。没有扫 ACT 的 chunk 视界、时间集成或重规划频率,专家–学习者差距的机制仍然开放:交接姿态误差、跟踪误差、手部驱动、容器接触都没被拆开。失败交接和成功交接的姿态偏差分布大量重叠,中位数差着 3.1° 对 2.2°、5.5 mm 对 3.9 mm,单靠交接状态解释不了。示范集没有试过比 297 条更大。DAgger 失败太狠,不能当速度鲁棒性的反例,只能当「这个实现没学会任务」。