Arrive and Survive: Scaling Safe Goal-Conditioned Policy Learning from One-Bit Failure Signals
Guopeng Li, Yiyang Duan, Yiru Jiao, Chengcheng Xu
cs.LG, cs.RO
2026-08-27
既有对比强化学习把失败前的短未来归一成单位质量,等于给快摔的动作打高分。Safe-CRL用存活质量加权InfoNCE并给策略加log Z,12个易失败任务上目标停留超过Scaling-CRL。
对比强化学习(CRL)把稀疏的「到没到目标」做成自监督:从当前状态-动作对出发,把未来真正到达过的目标当正样本,用InfoNCE训练 critic,再让 actor 去抬这条对比分数。Scaling-CRL 证明这条路能把网络堆到很深,到达能力跟着涨。
问题出在失败会立刻结束回合。摔倒、撞障碍、掉进坑,后面的状态不再是合法未来目标。既有 CRL 只拿失败前的未来做正样本,再把剩下的占用质量归一成 1。两条动作如果失败前看到的目标差不多,一条还能稳走很久,一条到了目标马上摔,critic 给的正样本监督几乎一样。短轨迹被放大,长轨迹被压扁。缺的是「存活质量」(survival mass):折扣未来目标占用里,被失败吃掉的那一块概率质量。
后果有两条。一是灾难性失败自举:训练早期回放里全是短近失败轨迹,反复当成功监督,策略被锁在摔法上。二是不可持续的到达:冲进目标区域,马上过冲撞墙或摔倒。
Safe-CRL 只动两处,不改动作空间,也不要额外安全标注,失败终止那 1 比特就够。
Z 由一个 4 层编码器估。从折扣几何分布抽未来步数 H,标签是失败是否发生在 H 之后,二元交叉熵训练。超时截断且没看到失败,当存活。Actor 更新时冻住 Z 编码器参数,但梯度仍穿过动作输入。其余架构跟 Scaling-CRL 一样,包括 log-sum-exp 分数正则。log Z 的系数理论值是 1,没有当成安全-目标权衡旋钮去调。
12 个 Brax 易失败导航和运动任务,主对比是同设定的 Scaling-CRL。Actor 和 critic 默认 64 层(Point Goal、Car Goal 用 8 层),γ=0.99,回合上限 1000 步,5 个随机种子。
| 任务 | Scaling-CRL 目标停留 | Safe-CRL |
| Ant Goal | 276.8 步 | 684.0 步 |
| Humanoid Goal | 22.2 步 | 266.4 步 |
| Humanoid Big Pitfall | 8.2 步 | 474.1 步 |
12 个任务上平均目标停留时间和平均存活时间全部更高。目标覆盖率 7 个任务升、5 个降,但降的那些任务停留时间仍大幅上升,说明不是靠少去难目标刷出来的。Ant Goal 一类覆盖率差得不多、停留和存活差得很大,对应「到了但待不住」。Humanoid 上 Scaling-CRL 存活时间全程偏低,更接近失败自举。
深度缩放里,8 层 Safe-CRL 就打平或超过 64 层 Scaling-CRL。Humanoid U-Maze 加到 256 层还在涨。4 层 Z 编码器只多约 4.2% 参数,每 1 亿环境步训练时间从 9.07 小时到 9.32 小时,多 2.8%。消融在较浅网络上做:16 层设定下 Humanoid Goal 目标停留,Scaling-CRL 13.8 步,只加质量加权 InfoNCE 到 28.3,只加 log Z 到 288.7,两者一起 297.0。log Z 是主力,加权 InfoNCE 是小头。目标会重生的 Point Goal / Car Goal 上,存活优势也比固定目标设定更大(Point +13.8% 对 +5.0%,Car +18.3% 对 +2.2%)。
很多目标条件控制环境本来就会失败终止,这 1 比特已经在环境里,不需要 CMDP 成本函数,也不要把失败做成一个特殊目标去改对比采样。想把 Scaling-CRL 用到会摔、会撞的机器人上,这两处修正是最小可用补丁。深度可扩展性还在,8 层就能超过原来的 64 层基线。
这是针对一个被理论钉死的偏置的渐进补丁,不是换损失碰运气。可视化里能看到绕开移动障碍的 S 形重规划、倒走回收、绕坑减速,都是从终止信号里长出来的,没有单独的安全奖励。
作者列了三条。Safe-CRL 只管失败终止的目标条件控制,不管不终止的安全代价或约束 RL。超时截断是右删失,当前把没观察到失败的 horizon 当存活,没有用 SVL 那套删失修正。探索机制没改,目标空间覆盖仍不均匀,人形绕坑任务里左右后侧成功率就不对称。
消融只在 4 个任务、较浅网络上做,Humanoid 上那些大数字外推到全部 12 个任务要留余地。β=1 是理论值,加大 β 会继续抬存活、对到达的影响随环境变,论文没有声称 1 在每个指标上都最优。用时序差分去学 Z,在 Car Goal 和 Humanoid Goal 上明显变差,所以默认仍是蒙特卡洛标签。