ChronoSRL:让强化学习 critic 的嵌入距离直接度量抵达目标的时间
Jan_R_Peters · x · 2026-10-01
达姆施塔特工业大学 Nico Bohlinger 与 Jan Peters 发布 ChronoSRL,为自监督强化学习(SRL)的 critic 引入「时间几何」:训练状态-动作与目标嵌入之间的距离去匹配 agent 抵达目标所需的实际时间(距离≈κτ),并在此基础上用两个头预测目标何时被到达、agent 会停留多久,策略同时最大化两者。
核心思想:空间上近的目标在时间上可能很远,嵌入距离应衡量「到达目标还要多久」而非空间远近。未被到达过的目标被推到 κW 之外。
实验结果:
- 在 7 个任务上对比 CRL、AC-CRL、SRL,覆盖 1 到 64 层不同网络深度
- 学习速度(AUC)与最终性能均领先,且用小得多的网络也能达到
- Ant Hardest Maze 中,其距离函数比空间距离更贴近剩余步数
应用方向:面向自监督机器人运动控制,在 Unitree Go2 上演示了速度跟踪、目标点到达与箱子攀爬的 sim-to-real 训练。论文、代码与在线 playground 均已开放。
「具身」频道最新
- 机器人部署公司多不赚钱,创始人缺自动化经验是主因 — ATTlKA · 2026-10-01
- Pollen Robotics:10950 台 Microduck 将于 12 月 10 日起分批发货 — andimarafioti · 2026-10-01
- OpenAI 与 Meta 转向「先软件后硬件」策略推出 AI 挂件设备 — haydenfield · 2026-10-01
- Runway 发布开源权重世界动作模型 Praxis-1,用视频预训练驱动机器人 — runwayml · 2026-10-01
- 首个可认证估计的 IMU 预积分因子论文,提交 ICRA 2027 — zhenjun_zhao · 2026-10-01
- Pow3R-SLAM 实测提速 1.6 倍、轨迹误差降 15%,深度作先验胜 MASt3R-SLAM — zhenjun_zhao · 2026-10-01