RL²-VLA 用强化学习提升机器人操作成功率

RL²-VLA 是一个面向视觉-语言-动作模型的自适应推理时引导框架。其思路是先依赖基础 VLA 的采样靠近目标物体,再预判失败时在潜在空间中自适应施加 RL 组合转向。该方法训练一个轻量级离线 RL 流匹配策略,推理时通过组合行动专家提升机器人操作的成功率,实现测试时扩展。

2026-08-18 ~ 2026-08-18 · 2 条相关