Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control?
Filippo Lazzati, Kyle Stachowicz, William Chen, Alberto Maria Metelli, Andrew Wagenmaker, Sergey Levine
cs.RO
2026-08-04
动作分块为何让机器人模仿学习更稳,一直没讲清。这篇证伪三个旧假说,指认真正机制是用过去观测预测动作与隐式集成,可用随机延迟集成平替、显式集成超越。
动作分块(action chunking)让策略一次预测并执行连续多步动作,是机器人模仿学习的事实标配,diffusion policy、ACT 都靠它涨点。但它为什么有效,大家各有说法,没人严格验证过。这篇要补上这个解释。
作者在 Libero-90(90 个桌面操作任务)和 Robomimic 两个仿真基准,以及 Franka 真机三个任务上,系统检验三个常见假说,再提出自己的解释。策略统一用 diffusion policy,图像观测,每个结果至少 3 个随机种子。
三个被检验的旧假说:时序一致性,即人演示的动作平滑相关,分块能更好建模这种时序;视界缩短(horizon reduction),即预测多步减少了误差累积;表征学习,即分块带来更好的特征。
作者的结论是:前两个的收益其实能被一个简单得多的东西吃掉,第三个站不住。
旧假说证伪。在 Libero-90 上,一个「延迟策略」(每步只用 k 步前的观测预测当前单步动作)就能追平甚至超过动作分块。说明真正起作用的是「用过去观测预测」这种非马尔可夫表达,把整段动作平滑播出来并不必要。时序一致性并非关键。他们在 VLA 模型 π0.5 上也复现:当延迟策略跑,效果跟标准动作分块一样。
隐式集成才是关键。在更难的 Robomimic 上,延迟策略追不上动作分块。作者的解释是分块还有第三个好处:训练时它同时学了 aₜ|oₜ、aₜ|oₜ₋₁、……、aₜ|oₜ₋k₊₁ 一堆预测器,等于在用不同时延的特征做集成,像随机森林那样聚合降方差。单用一个延迟策略只取了其中一个,自然吃亏。
随机延迟集成(RDE)能平替分块。既然集成的关键是「用到所有时延关系」,那就每步随机抽一个延迟来预测。结果如下:
| 任务 | 单步策略 | 动作分块 | 延迟 | 随机延迟集成 |
| Libero-90 | 68.9 | 89.2 | 94.0 | 93.6 |
| Robomimic Tool Hang | 28.0 | 75.2 | 51.6 | 71.8 |
| Robomimic Transport | 3.3 | 12.6 | 7.9 | 12.1 |
随机延迟集成在所有设置(含真机三个任务)都追平动作分块,而它根本不用真的播动作块。
显式集成还能更好。把上面这套「隐式集成」显式化,训练 m 个独立策略再聚合,效果超过动作分块。Robomimic Transport 从 12.6% 拉到 41.5%(约 +29 个百分点),Tool Hang 从 75.2% 到 87.6%。
对做机器人的从业者,结论能直接上手。动作分块不是魔法,它的全部收益可以拆成「基于过去观测预测」和「集成」两件事,而这两件事都有更便宜或更强的替代。想省事就用随机延迟集成平替;想要更高上限就上显式集成。这给了一条不依赖分块、可解释的改进路线。
作者承认一个重要的边界条件:控制频率。在他们用的 15–20Hz 上延迟策略够用,但到 50–60Hz 延迟策略就追不上分块了,得把 5 步子块当「一个动作」、把有效频率压回 10–20Hz 才行。他们推测这跟人的视觉引导行为处在 2–10Hz 有关。也就是说「时序一致性」在高速控制下又变得重要,结论带着频率前提。
真机实验还有个工程坑:停下来算下一动作时机器人会漂移,他们靠「边执行边算下一动作」绕过,代价是恒定多一个时步延迟。这套工程处理会不会影响结论的干净度,论文没深究。另外 Transport、Tool Hang 的绝对成功率本身就低(12.6%、75.2%),提升幅度好看但离「解决」还远。