把对比强化学习扩展到动作块:离线提升 31.7%、在线提升 93.1%
burny_tech · x · 2026-09-04
一组研究者将自监督强化学习中的对比 RL 从单步动作扩展到动作块(action chunks)层面,取得大幅提升:离线任务 +31.7%,在线任务 +93.1%。
关于动作块化为何有效,此前已有多种解释,该工作提出了一个新视角:块化改善了 critic 的表征质量。这对机器人与序列决策领域的 RL 训练实践有直接参考价值。
所属事件:研究:动作分块让对比强化学习在线性能提升逾九成(3 条相关)→
「具身」频道最新
- Oura 提交美股 IPO,申请代码 OURA,年销智能戒指超 360 万枚 — Polymarket · 2026-09-04
- 博主申请购买25+辆Cybercab组Robotaxi车队,将全程公开运营账本 — lasas · 2026-09-04
- 用 Fable 5.1 剪视频:儿童 AI 电脑 Daso 曝产品预告片 — NERDDISCO · 2026-09-04
- 马斯克确认:Cybercab 车机 UI 基于 Unreal Engine 打造 — elonmusk · 2026-09-04
- Polymarket:年底前加州上线 robotaxi 概率仅 18%,奥斯汀已随处可见 — Polymarket · 2026-09-04
- YC 新公司 Ultrasonium 用声波控金属,宣称制造提速 15 倍降本 75% — ycombinator · 2026-09-04