亚马逊 StructRL:可验证子任务中间奖励,提升长程机器人操作

amazon · hf · 2026-09-30

VLA 模型在需要单指令连续多步操作的长程任务上仍吃力,而现有在线 RL 多只在任务完全成功后给奖励,监督稀疏、无法区分早期失败与部分进展。

StructRL 是亚马逊提出的在线 RL 框架:把任务分解为可验证子任务,仅在前置子任务完成后发放中间奖励,并按完成进度缩放奖励。在 RoboCasa365 与 LIBERO-Long 上配合 GR00T-N1.5 与 pi 0.5,StructRL 持续优于受评在线 RL 基线,证明结构化中间奖励能有效改进长程 VLA 后训练。代码已开源。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →