把对比强化学习扩展到动作块:离线提升 31.7%、在线提升 93.1%

burny_tech · x · 2026-09-04

一组研究者将自监督强化学习中的对比 RL 从单步动作扩展到动作块(action chunks)层面,取得大幅提升:离线任务 +31.7%,在线任务 +93.1%。

关于动作块化为何有效,此前已有多种解释,该工作提出了一个新视角:块化改善了 critic 的表征质量。这对机器人与序列决策领域的 RL 训练实践有直接参考价值。

所属事件:研究:动作分块让对比强化学习在线性能提升逾九成(3 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →