把动作按三步一组切块,对比强化学习离线涨 31.7%、在线涨 93.1%

ben_eysenbach · x · 2026-09-03

arXiv 论文《Three Steps at a Time: Learning Representations from Action Sequences in Contrastive RL》提出把对比强化学习(CRL)从单步动作扩展到动作块(action chunks),在 18 个离线与 11 个在线基准环境中分别带来 +31.7% 与 +93.1% 的提升。

通常动作分块的收益被归因于能建模非马尔可夫的时序扩展策略并传递无偏多步回报,但作者发现这些解释对 CRL 只部分成立:实证表明在 CRL 语境下,一个动作块比单个动作携带更多关于目标的信息,可测量地改善了 critic 的表示,使算法显著更有效。

论文、项目网站与代码均已公开。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →