把动作按三步一组切块,对比强化学习离线涨 31.7%、在线涨 93.1%
ben_eysenbach · x · 2026-09-03
arXiv 论文《Three Steps at a Time: Learning Representations from Action Sequences in Contrastive RL》提出把对比强化学习(CRL)从单步动作扩展到动作块(action chunks),在 18 个离线与 11 个在线基准环境中分别带来 +31.7% 与 +93.1% 的提升。
通常动作分块的收益被归因于能建模非马尔可夫的时序扩展策略并传递无偏多步回报,但作者发现这些解释对 CRL 只部分成立:实证表明在 CRL 语境下,一个动作块比单个动作携带更多关于目标的信息,可测量地改善了 critic 的表示,使算法显著更有效。
论文、项目网站与代码均已公开。
「研究」频道最新
- Schmidhuber 谈循环深度:2015 年论文已提出抽象空间内思考 — SchmidhuberAI · 2026-09-03
- 开源检索研究者 Matthew Yang 入读 MIT 读博 — lateinteraction · 2026-09-03
- 大学医院系统新闻稿与论文数据被指严重脱节 — EricTopol · 2026-09-03
- 斯坦福论文提出双向扩散桥,统一文生图与图生文反演框架 — burkov · 2026-09-03
- Hugging Face 工程师开源 abcGPT:从百万声音中调出你要的文风 — iamtrask · 2026-09-03
- ChatGPT 助攻破解 30 年数学难题,稳定分叉猜想被证伪 — burny_tech · 2026-09-03