动作分块为何让机器人更稳:靠的是隐式集成,不靠时序一致

Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control?

Filippo Lazzati, Kyle Stachowicz, William Chen, Alberto Maria Metelli, Andrew Wagenmaker, Sergey Levine

cs.RO

2026-08-04

动作分块为何让机器人模仿学习更稳,一直没讲清。这篇证伪三个旧假说,指认真正机制是用过去观测预测动作与隐式集成,可用随机延迟集成平替、显式集成超越。

这篇在解决什么

动作分块(action chunking)让策略一次预测并执行连续多步动作,是机器人模仿学习的事实标配,diffusion policy、ACT 都靠它涨点。但它为什么有效,大家各有说法,没人严格验证过。这篇要补上这个解释。

方法

作者在 Libero-90(90 个桌面操作任务)和 Robomimic 两个仿真基准,以及 Franka 真机三个任务上,系统检验三个常见假说,再提出自己的解释。策略统一用 diffusion policy,图像观测,每个结果至少 3 个随机种子。

三个被检验的旧假说:时序一致性,即人演示的动作平滑相关,分块能更好建模这种时序;视界缩短(horizon reduction),即预测多步减少了误差累积;表征学习,即分块带来更好的特征。

作者的结论是:前两个的收益其实能被一个简单得多的东西吃掉,第三个站不住。

结果

旧假说证伪。在 Libero-90 上,一个「延迟策略」(每步只用 k 步前的观测预测当前单步动作)就能追平甚至超过动作分块。说明真正起作用的是「用过去观测预测」这种非马尔可夫表达,把整段动作平滑播出来并不必要。时序一致性并非关键。他们在 VLA 模型 π0.5 上也复现:当延迟策略跑,效果跟标准动作分块一样。

隐式集成才是关键。在更难的 Robomimic 上,延迟策略追不上动作分块。作者的解释是分块还有第三个好处:训练时它同时学了 aₜ|oₜ、aₜ|oₜ₋₁、……、aₜ|oₜ₋k₊₁ 一堆预测器,等于在用不同时延的特征做集成,像随机森林那样聚合降方差。单用一个延迟策略只取了其中一个,自然吃亏。

随机延迟集成(RDE)能平替分块。既然集成的关键是「用到所有时延关系」,那就每步随机抽一个延迟来预测。结果如下:

任务单步策略动作分块延迟随机延迟集成
Libero-9068.989.294.093.6
Robomimic Tool Hang28.075.251.671.8
Robomimic Transport3.312.67.912.1

随机延迟集成在所有设置(含真机三个任务)都追平动作分块,而它根本不用真的播动作块。

显式集成还能更好。把上面这套「隐式集成」显式化,训练 m 个独立策略再聚合,效果超过动作分块。Robomimic Transport 从 12.6% 拉到 41.5%(约 +29 个百分点),Tool Hang 从 75.2% 到 87.6%。

为什么重要

对做机器人的从业者,结论能直接上手。动作分块不是魔法,它的全部收益可以拆成「基于过去观测预测」和「集成」两件事,而这两件事都有更便宜或更强的替代。想省事就用随机延迟集成平替;想要更高上限就上显式集成。这给了一条不依赖分块、可解释的改进路线。

局限与存疑

作者承认一个重要的边界条件:控制频率。在他们用的 15–20Hz 上延迟策略够用,但到 50–60Hz 延迟策略就追不上分块了,得把 5 步子块当「一个动作」、把有效频率压回 10–20Hz 才行。他们推测这跟人的视觉引导行为处在 2–10Hz 有关。也就是说「时序一致性」在高速控制下又变得重要,结论带着频率前提。

真机实验还有个工程坑:停下来算下一动作时机器人会漂移,他们靠「边执行边算下一动作」绕过,代价是恒定多一个时步延迟。这套工程处理会不会影响结论的干净度,论文没深究。另外 Transport、Tool Hang 的绝对成功率本身就低(12.6%、75.2%),提升幅度好看但离「解决」还远。

术语

原文与代码

社区讨论

相关论文

全部论文解读