ChronoSRL:让强化学习 critic 的嵌入距离直接度量抵达目标的时间

Jan_R_Peters · x · 2026-10-01

达姆施塔特工业大学 Nico Bohlinger 与 Jan Peters 发布 ChronoSRL,为自监督强化学习(SRL)的 critic 引入「时间几何」:训练状态-动作与目标嵌入之间的距离去匹配 agent 抵达目标所需的实际时间(距离≈κτ),并在此基础上用两个头预测目标何时被到达、agent 会停留多久,策略同时最大化两者。

核心思想:空间上近的目标在时间上可能很远,嵌入距离应衡量「到达目标还要多久」而非空间远近。未被到达过的目标被推到 κW 之外。

实验结果:

应用方向:面向自监督机器人运动控制,在 Unitree Go2 上演示了速度跟踪、目标点到达与箱子攀爬的 sim-to-real 训练。论文、代码与在线 playground 均已开放。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →