新国大提出 RL² 框架:VLA 模型域外任务成功率提升 17%
NationalUniversityofSingapore · hf · 2026-08-03
新加坡国立大学提出 RL² 框架,通过在视觉-语言-动作(VLA)模型的潜空间上训练轻量级离线强化学习策略,在推理时进行自适应组合转向。
- 核心机制:提取 VLA 动作专家的潜表征训练 RL 策略,在推理阶段将其流速度与冻结的 VLA 组合。该策略仅在预测基础模型可能失败时激活干预,避免对已准确的动作造成多余扰动。
- 实验效果:在 SIMPLER 和 PolaRiS 基准测试中,该框架将域外任务的成功率最高提升了 17.3%,且真实世界实验证明该增益能从仿真有效迁移到实体机器人。
「具身」频道最新
- 布宜诺斯艾利斯将办机器人开发者聚会,含 ESP32 实操工作坊 — StewartalsopIII · 2026-08-03
- 单GPU服务10+机器人:开源VLA部署新架构 — danfei_xu · 2026-08-03
- 开源四足机器人框架 OpenCat 获 5k Star — tom_doerr · 2026-08-03
- 求之科技两月融资超2亿美元,发布具身大模型ORION-0 — 创业邦 · 2026-08-03
- 本地DGX Spark运行Minimax H3生成720p视频,耗时1小时44分 — Saren-WTAKO · 2026-08-03
- OpenRoboto 开源机器人挑战赛:微调 π0.5 赢取代币奖励 — const_reborn · 2026-08-03