Reflex 三阶段训练法:RL 全身控制+延迟观测推理+RGB-D 接地
DJiafei · x · 2026-10-09
Reflex 采用三阶段训练:1)用强化学习学习全身接箱控制;2)让策略从延迟且不完整的观测中推断箱体动力学;3)保持控制器固定,训练 RGB-D 观测历史直接恢复该动力学表征。这种分解让每项能力都有直接训练信号,使视觉学习显著更易扩展。项目作者来自华盛顿大学、斯坦福大学等机构。
所属事件:UW 发布 Reflex:宇树 G1 纯视觉 1 秒接住人抛来的箱子(9 条相关)→
「具身」频道最新
- 斯坦福 Mulligan:瞄准失败初始状态采数据,2550 次盲评超越均匀采集 — ZhaoMandi · 2026-10-10
- 用 ESP32 开发板自制机器狗,开源硬件项目可在家复刻 — natesiggard · 2026-10-10
- Nvidia 发布 ARC:不加新数据不改架构,机器人推理成功率提升 5 倍 — arankomatsuzaki · 2026-10-10
- 开源 AgenticROS 推出万圣节技能:给 AI agent 一个机器人身体去讨糖 — chrismatthieu · 2026-10-10
- SPECS 眼镜新玩法:扫描真实物体留下虚拟信息球供人发现 — stspanho · 2026-10-10
- 3 万小时第一人称视频研究:数据加百倍,物体交互仍拉胯 — arankomatsuzaki · 2026-10-10