RL²-VLA 用强化学习提升机器人操作成功率
RL²-VLA 是一个面向视觉-语言-动作模型的自适应推理时引导框架。其思路是先依赖基础 VLA 的采样靠近目标物体,再预判失败时在潜在空间中自适应施加 RL 组合转向。该方法训练一个轻量级离线 RL 流匹配策略,推理时通过组合行动专家提升机器人操作的成功率,实现测试时扩展。
2026-08-18 ~ 2026-08-18 · 2 条相关
- RL2-VLA:视觉语言动作模型的自适应 RL 组合转向与测试时扩展 — rsasaki0109 · 2026-08-18
- RL²-VLA:通过强化学习提升机器人操作成功率 — rsasaki0109 · 2026-08-18