STEAM:机器人离线RL新框架
青稞AI · wechat · 2026-07-20
这篇公众号介绍了清华于超老师团队与正行创新联合提出的 **STEAM**:一个面向真实世界机器人学习的、**无需人工逐帧标注**的帧级优势估计框架。 ## 核心思路 - 针对真实机器人数据中常见的停顿、纠错、失败、次优行为混杂问题,STEAM 用专家轨迹中帧对之间的**归一化时间偏移**做自监督信号。 - 通过训练多个 temporal-offset 预测器,把结果转成衡量局部任务进展的优势分数。 - 为了应对混合质量 rollout,方法还采用**集成模型中的最小优势值**做保守评分,更稳健地识别有效推进、失败回退与恢复过程。 ## 实验结果 - 在双臂毛巾折叠、薯片结账、可乐补货、单臂抓取放置等真实机器人任务中,STEAM 能有效发现低质量片段。 - 结合 CFGRL 后,相比基线方法,性能提升分别达到 **59% / 54.3% / 23% / 16.2%**。 ## 其他信息 - 文末还预告了 7 月 21 日的直播分享,由 STEAM 一作刘志豪讲解方法、对比现有方案、框架原理与真实机器人实验。
「具身」频道最新
- FLock 上线机器人 VLA 训练任务 — matlabulous · 2026-07-20
- 机器人开始装太阳能板 — lukas_m_ziegler · 2026-07-20
- 具身智能数据成上游战场 — 创业邦 · 2026-07-20
- 人形战斗机器人演示 — CurieuxExplorer · 2026-07-20
- 机器人评测改看95%下置信界 — DominiqueCAPaul · 2026-07-20
- Optimus 3 可能要等到明年 — Scobleizer · 2026-07-20