RL²-VLA:通过强化学习提升机器人操作成功率

rsasaki0109 · x · 2026-08-18

RL²-VLA 是一个自适应推理时引导框架,通过在 VLA 模型的潜在空间应用强化学习来提升机器人操作能力。该方法训练一个轻量级离线 RL 流匹配策略,并在推理时通过组合行动专家的流速度来引导基础 VLA。研究发现在预测到失败时激活组合引导最为有效。实验显示,该方法在 SIMPLER、PolaRiS 和真实机器人任务中平均分别提升成功率 10.1%、8.9% 和 19.5%。

所属事件:RL²-VLA 用强化学习提升机器人操作成功率(2 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →