STEAM:机器人离线RL新框架

青稞AI · wechat · 2026-07-20

这篇公众号介绍了清华于超老师团队与正行创新联合提出的 **STEAM**:一个面向真实世界机器人学习的、**无需人工逐帧标注**的帧级优势估计框架。 ## 核心思路 - 针对真实机器人数据中常见的停顿、纠错、失败、次优行为混杂问题,STEAM 用专家轨迹中帧对之间的**归一化时间偏移**做自监督信号。 - 通过训练多个 temporal-offset 预测器,把结果转成衡量局部任务进展的优势分数。 - 为了应对混合质量 rollout,方法还采用**集成模型中的最小优势值**做保守评分,更稳健地识别有效推进、失败回退与恢复过程。 ## 实验结果 - 在双臂毛巾折叠、薯片结账、可乐补货、单臂抓取放置等真实机器人任务中,STEAM 能有效发现低质量片段。 - 结合 CFGRL 后,相比基线方法,性能提升分别达到 **59% / 54.3% / 23% / 16.2%**。 ## 其他信息 - 文末还预告了 7 月 21 日的直播分享,由 STEAM 一作刘志豪讲解方法、对比现有方案、框架原理与真实机器人实验。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →