Simple Actors and Deep Critics for Scalable Reinforcement Learning
Guhyeon Kang, Jaehwi Lee, Minhae Kwon
cs.LG
2026-08-27
LAC把容量砸在训练后扔掉的critic上:32层残差MLP配轻量确定性actor,OGBench七环境均值成功率70%对标最强flow基线的36%,单步延迟0.24ms。
离线强化学习近两年把政策表达力押在扩散和流匹配 actor 上。好处是能拟合离线数据里的多峰动作分布;代价是每一步决策都要走多步去噪或积分,机器人、嵌入式控制每次都要付这笔账。
actor–critic 两边的角色并不对称:critic 只在训练时给政策梯度信号,部署时扔掉;actor 每一步都要跑。容量砸在 critic 上是一次性训练开销,砸在 actor 上是每次决策都要付的账。问题是,离线 RL 里把 MLP critic 加深,训练经常崩,文献里 critic 一直停在两三层。
LAC(Light Actor, deep Critic)把这个不对称做成配方。actor 是轻量确定性 MLP,训练目标和 TD3+BC 一类方法一样:最大化 critic 打分,再加行为克隆正则,把政策拴在数据集动作附近。部署时一次前向就出动作。
加深 critic 会撞上三条独立的失败模式,各用一剂药:
n-step 在浅 critic 上几乎没好处,因为噪声循环还没起来;分类损失也没法被 MSE 替换。两条都拿掉,深度就重新变成负担。默认 critic 是 32 层残差 MLP,约 215 万参数,51 个分类原子,n=4。actor 分两档:LAC-S 是 [256, 256],约 13 万参数;LAC-L 是 [512]×4,体量和 flow 基线对齐。
评测是 OGBench 7 个环境、每个 5 个任务变体,4 个随机种子,报成功率。延迟在单张 RTX 3090、batch size 1 上按每步动作的墙钟时间计。
| 方法 | 7 环境均值成功率 | 单步延迟 |
| BC | 3% | 未报 |
| ReBRAC | 30% | 0.27ms |
| FQL(蒸馏 flow) | 36% | 0.27ms |
| LAC-S | 52% | 0.24ms |
| LAC-L | 70% | 0.31ms |
| IDQL(10 步扩散) | 15% | 0.95ms |
长地平 locomotion 上差距最大:hum-large 上 LAC-L 69±15,最强 flow 基线 IFQL 只有 11±2;puzzle-3x3 上 LAC-L 95±1,FQL 30±1。scene 上 LAC 没有赢,FQL 56±2,LAC-L 41±39,方差也大。
消融对得上三条失败模式。在 task1 变体上,完整配方平均 73;去掉 n-step 掉到 33;换成 MSE 掉到 37,其中 hum-large 从 79 崩到 7;两样都去掉只剩 9。深度×n 的热力图里,浅于 8 层怎么改 n 都学不会;过了 16 层,只有 n=1 会随深度退化(深度 32 时 42%,深度 256 时 14%),n≥2 稳住,n=4 最好。n=8 反而退回 n=2 的水平,horizon 不是越大越好。
同一套 critic 接到别人的 actor 上也涨。hum-medium 的 task1 上,TD3+BC 从 10 到 46(+36),FQL 从 19 到 57(+38),蒸馏扩散 CAC 从 38 到 97(+59)。延迟上相对 LAC-S,IDQL 慢 3.96 倍,IFQL 慢 2.67 倍;对已经蒸馏成单步的 FQL、SRPO、CAC,延迟优势几乎没有。
给部署侧一个清楚的取舍:多峰动作分布不一定非要生成式 actor 来扛。critic 够强时,轻量确定性政策就能把信号摊平成一次前向。机器人、边缘控制这类每步都计较毫秒的场景,这比再蒸馏一个扩散政策更直接。
critic 配方还能当即插件。不想换 actor 家族,只换 critic,论文里五个方法都涨。这是渐进改进,不是新算法范式,但把「容量该砸哪边」说清楚了。确定性 actor 仍是这个谱系上最省推理的一点,不是表达力已经多余:CAC 配同一套 critic 能到 97%,说明生成式 actor 在高维动作上仍有余量。
作者自己写了:评测只覆盖状态输入的 OGBench,没有像素观测,也没有真机。scene 上 LAC 没赢,方差还大,操作序列加稀疏奖励时,确定性 actor 的表达力缺口还在。n 要按任务调,n=8 会退步。基线数字大多引自 FQL 那篇,只有 TD3+BC 自己重跑,跨实现对比会有缝。宣传的近 4 倍延迟只相对多步生成式 actor,对已经蒸馏成单步的方法几乎没有优势。