2026-08-28
Harvard团队用Banyan独立控制布局、物体与任务树拓扑;多样性把单次迁移落差压近0,但n=256时十段序列终点成功率约0.80,低于n=16时的0.95。
训练任务足够杂,冻结权重后的零样本泛化会变好,这点在 XLand、AdA 一类大规模环境里已经看到。持续强化学习问的是另一件事:任务分布在换,权重要继续更新,多样性会不会让学习过程本身更可迁移?现成基准要么任务数只有几百,要么海量程序化任务却拆不开多样性从哪来。
Harvard / Kempner 的 Banyan 把这个问题拆开:同一套 GPU 加速、MiniGrid 风格环境里,布局、任务树实例、任务树拓扑三条轴可以独立扫。
一个任务由布局 L、拓扑 T、物体指派 O 组成。布局管墙和初始位置;任务树规定叶子物体经过变换或两两合成,最终做出根目标。智能体看见整张格子和目标物体描述,看不见树结构。动作包括移动、拾取、放下、单物体变换。做成根目标得 +1,合出无解死局得 −1。深度 1 到 6 嵌套,更深任务包含更浅子任务,多样性按深度 6 的任务数计。
前向迁移用相邻分布的落差 Δi = 上一段终点成功率 − 下一段起点成功率,接近 0 表示进新分布时几乎不掉。后向迁移看后来训练对早先分布的改变,负值就是遗忘。算法用尽量干净的 PPO 和 PQN,十段序列再加上针对可塑性丧失的 Continual Backprop。
单次切换:d1 沿一条轴加多样性,d2 是同轴 1 万个新布局/物体或 256 个新拓扑。十段序列把布局和拓扑一起从 n=1 扫到 256,每段最多 65536 个独特任务。PPO 5 个种子,PQN 3 个种子。
单次切换里,三条轴加大多样性都把 Δ2 推向 0:智能体进 d2 时的成功率接近刚在 d1 练完的水平,PPO 和 PQN 都成立。后向迁移只有扫拓扑时明显变好;布局数和物体数几乎不动这项。PQN 在边界上的 TD 误差随多样性下降,说明特征对分布外更准。连续控制的 Point Mass 复现了同一方向:物体数从 1 加到 1000,Δ2 从 0.95 降到 0.50,B(2,1) 从约 0.80 降到约 0.01。
十段序列把故事拧过来。多样性仍然让每一次边界的 Δi 接近 0,但长期学习停了。
| 每段多样性 n | d1 终点成功率 | d10 终点成功率 | 切换时掉点 |
| 16 | 约 0.74 | 约 0.95 | 接近 0,段内继续涨 |
| 256 | 约 0.80 | 约 0.80 | 接近 0,段内不再涨 |
d10 终点随多样性从 16 往后单调下降:0.95、0.91、0.86、0.82、0.80。后向迁移反过来变强:n=256 时 d1 从第一段结束的约 0.80 升到第十段后的约 0.95。网络还在学跨分布的共用结构,学不会每段新分布自己的那部分。Continual Backprop 没有救这个平台。
「多给点杂任务」对冻结策略的零样本很有用,对要继续改权重的持续 RL 可能有害。多样性买到的是进新任务时不摔跤,付出的是后来专精不了。中等多样性(这里是 n=16)反而让十段序列越练越好。做大规模多任务 RL 或持续训练的人,不能默认把任务数拉满。Banyan 把布局、实例、拓扑拆开,适合在学术算力上把这个权衡测清楚。
主结果在格子世界。连续控制只复现了单次切换,没有十段序列,也没有视觉多样性。智能体全程是循环网络,Transformer 会不会同样被高多样性卡住,没有数据。基线只有 PPO、PQN 和 CBP,回放、模块化策略、基于模型的规划会不会把多样性的长期好处救回来,仍是空的。论文把平台归因为干扰而不是优化失败,主要证据是 CBP 无效且旧任务还在涨;没有把干扰从表示塌缩或容量争用里再拆一层。