亚马逊 StructRL:可验证子任务中间奖励,提升长程机器人操作
amazon · hf · 2026-09-30
VLA 模型在需要单指令连续多步操作的长程任务上仍吃力,而现有在线 RL 多只在任务完全成功后给奖励,监督稀疏、无法区分早期失败与部分进展。
StructRL 是亚马逊提出的在线 RL 框架:把任务分解为可验证子任务,仅在前置子任务完成后发放中间奖励,并按完成进度缩放奖励。在 RoboCasa365 与 LIBERO-Long 上配合 GR00T-N1.5 与 pi 0.5,StructRL 持续优于受评在线 RL 基线,证明结构化中间奖励能有效改进长程 VLA 后训练。代码已开源。
「具身」频道最新
- AnyStep-WAM:按任务难度自适应分配去噪步数,平均省 60% 步数不掉成功率 — Rui Wang · 2026-09-30
- Simify:单张图像实时转仿真,进化搜索解机器人空间推理 — Ed__Johns · 2026-09-30
- ZeroBot:零演示零预训练,119 秒从零学会机器人操作,成功率 87% — Ed__Johns · 2026-09-30
- LadderMan 入选 CoRL 2026 Spotlight:人形机器人零样本爬梯作业 — yuewang314 · 2026-09-30
- Reddit 热议:鸵鸟形家用机器人 Goose 比人形更实用? — fhpapa · 2026-09-30
- 内存价格暴涨,端侧 AI 硬件团队称物料成本已超 300 美元 — stephen280up · 2026-09-30