Deep Reinforcement Learning in a Handful of Trials using Probabilistic Dynamics Models
Kurtland Chua, Roberto Calandra, Rowan McAllister, Sergey Levine
cs.LG, cs.AI, cs.RO, stat.ML
2018-05-31
把深度网络动力学模型做成「概率集成」,用粒子采样传播不确定性并做 MPC 规划;在 MuJoCo 上追平 PPO/SAC 的渐近性能,半猎豹任务样本量只需 PPO 的 1/125、SAC 的 1/8。
2018 年的这篇要回答一个问题:基于模型的强化学习(MBRL)样本效率好,但渐近性能一直追不上最好的无模型算法,尤其在用深度网络当动力学模型的时候。根源是神经网络在小数据上过拟合,预测往外推几步就崩,基于这个烂模型去规划自然学不好。已有的高效模型(高斯过程 GP)能快速学,但扛不住机器人接触这种不连续、高维的动力学。作者要的是:既要深度网络的容量,又要小数据上不崩,还得追平无模型的最终性能。
PETS(Probabilistic Ensembles with Trajectory Sampling)的核心是把两类不确定性都喂给模型。aleatoric(数据本身的噪声)用一个输出高斯分布的概率网络抓;epistemic(数据不够带来的主观不确定)用 5 个 bootstrap 集成抓,集成之间在数据稀疏处分歧大,分歧就是认知不确定的信号。
规划用 MPC:每一步用交叉熵方法(CEM)采样一批候选动作序列,用模型把当前状态展开成 20 个粒子组成的轨迹,评估期望回报,只执行第一个动作,下一步重算。粒子怎么传播是关键,叫 trajectory sampling:每个粒子绑定一个 bootstrap 模型,按它的概率预测往前采。TS∞ 让粒子整条轨迹都用同一个模型,这样认知不确定和偶然不确定可分;TS1 每步重抽模型。这套把「用模型规划」和「诚实表达模型不知道什么」焊在了一起。
在 MuJoCo 的四个连续控制任务上(cartpole、pusher、reacher、half-cheetah),和当时最强的无模型(PPO、SAC、DDPG)、基于模型(Nagabandi 的确定网络、几种 GP)对比。
| 任务 | 关键结果 |
| half-cheetah | 追平 PPO/SAC 渐近性能,样本只需 SAC 的 1/8、PPO 的 1/125 |
| 四任务整体 | 不到 100 次试验(100K 步)内达到 PPO 的渐近性能 |
模型选择的消融很说明问题:模型类型排名 PE 大于 P 大于 DE 大于 D,同时抓两类不确定的集成最强,只抓一类的次之,确定网络最差。而用什么技巧去传播不确定性(各种 E、MM、DS、TS)影响小得多,决定上限的是模型本身的不确定性建模,不是传播的花活。GP-MM 只在低维的 cartpole 上略胜,但时间和状态维都是三次、二次标度,高维任务跑不动。
这是模型基深度 RL 第一次在标准基准上真正追平无模型算法的渐近性能,打破了「模型基高效但天花板低」的老印象。对做机器人和真实系统的人,样本效率是能不能上真机的命门,1/125 意味着原来几百万步才能学会的,几万步就行。「把不确定性显式建进模型」这个结论,后来成了 model-based RL 和不确定性量化的一条主线。
要泼冷水的是它的现实形态:它没有策略网络,测试时靠在线 MPC 实时规划,计算开销大;作者试过用这个模型直接训一个参数化策略,梯度在不确定性模型里发散(chaotic gradients),没成,留给后续。
作者自述:没把 epistemic 不确定性用来做定向探索(只是被动地靠它避免过拟合),这是未来工作;策略学习那条路没走通。
站在今天的视角补两条:只在 MuJoCo 连续控制、中低维任务上验证,离图像输入、高维、真实机器人的复杂接触还有距离;MPC 在线规划的计算成本对实时控制(文中提 20Hz 以上)是硬约束,「样本省」和「单步算得快」是两件事。