Human-Timescale Adaptation in an Open-Ended Task Space
Adaptive Agent Team, Jakob Bauer, Kate Baumli, Satinder Baveja, Feryal Behbahani, Avishkar Bhoopchand, Nathalie Bradley-Schmieg, Michael Chang, Natalie Clay, Adrian Collister, Vibhavari Dasagi, Lucy Gonzalez, Karol Gregor, Edward Hughes, Sheleem Kashem, Maria Loks-Thompson, Hannah Openshaw, Jack Parker-Holder, Shreya Pathak, Nicolas Perez-Nieves, Nemanja Rakicevic, Tim Rocktäschel, Yannick Schroecker, Jakub Sygnowski, Karl Tuyls, Sarah York, Alexander Zacherl, Lei Zhang
cs.LG, cs.AI, cs.NE
2023-01-18
DeepMind 用 meta-RL、Transformer-XL 记忆和自动课程,在 XLand 2.0 上训出 AdA。held-out 三维任务上超过八成能跨 trial 适应,时间尺度接近人类玩家,最大模型约五亿参数。
大模型在监督和自监督里已经能 few-shot 适应,但这套能力一直没完整迁到强化学习。meta-RL 理论上能让记忆在测试时当在线学习器用,奖励一稀疏、任务空间一大,训练信号就塌。真实世界里大量问题没法 zero-shot 硬过,必须靠几分钟试错把隐藏动力学摸出来。
DeepMind 的 Adaptive Agents Team 要的是一个能在开放 3D 具身任务上、按人类时间尺度做 in-context 适应的 RL agent:测试时不再更新权重,只靠记忆跨 trial 学。这个 agent 叫 AdA。
训练场是 XLand 2.0。在原版 XLand 上加了一套 production rules:满足某个谓词就把物体消掉、再生成新物体,规则还可以整条、整类物体或谓词被遮住。任务空间号称超过 10^40,训练池最大到 250 亿个不同任务。每个 episode 由 1 到 6 个 trial 组成,单 trial 长 10 到 40 秒;trial 之间环境重置,agent 记忆不重置,于是记忆里会沉淀出一个在线学习算法。
三条一起才跑得动:
单智能体主实验:169M TXL / 总计 353M,记忆 1800 步,任务池 250 亿,训 1000 亿步。多智能体:265M TXL / 总计 533M,训 700 亿步。
在与训练同分布的 1000 个 held-out 任务上,给更多 trial,AdA 在超过 80% 的任务上提高最后一轮得分。从 1 trial 到 2 trial 跳得最猛,继续加到 13 trial 还能涨。1 trial 的 zero-shot 不比专门按单 trial 训的基线差。
30 个手写 probe 任务上,19 名人类玩家和 AdA 的中位分都随 trial 数上升,斜率接近。人类能做、AdA 做不了的,典型是 Spacer Tool 这种训练分布里几乎不出现的工具使用;AdA 能做、人做不了的,多半是精细控制,比如 Small Workstation。
多智能体自博弈在约 90% 的 held-out 任务上也能适应。合作任务上自博弈明显高于跟随机动作 co-player 玩,说明出现了分工和路径协调,而这些行为是测试时才长出来的。
缩放方面,Transformer 非嵌入参数从 6M 到 265M、有效记忆从 600 到 4200 步、任务池从 2 亿到 250 亿,log-log 上都接近幂律。放大对 20 分位比中位更明显,对 few-shot 比 zero-shot 更明显。训练 trial 从 6 加到 24、记忆有效长度加到 7200,适应能拉到超过 30 分钟。第一人称示范放进第一个 trial 当 prompt,手写任务中位分全程高于无 prompt 基线,但学不像示范本身。
这是把 foundation model 那套「预训练 + 上下文适应」搬进在线 RL 的一次硬证明。不靠离线数据集、不靠测试时微调,agent 自己在开放任务上采集数据,也能长出假设驱动的探索、知识利用和示范 prompt。对想做具身通用智能的人,配方很清楚:任务分布要平滑且大,记忆必须能跨 trial 注意,课程要把样本堆在能力边界,大模型还得靠蒸馏才能从零训起来。
诚实说,这是模拟器里的渐进式放大,不是能直接部署的机器人策略。XLand 的动力学是人造 DSL,离真实物理和开放词汇指令还远。
论文没有单独开局限节,但实验自己露出了边界。缩放只跨了两到三个数量级,而且没训到收敛;所有尺寸共用 23M teacher,曲线不那么直可能跟这个有关。按 FLOPs 而不是步数比,最大模型并不总占优。训练只到 6 trial 时,适应过了 13 trial 就停;要 many-shot 必须把训练 horizon 一起拉长。Spacer Tool 这类分布外工具使用过不去,说明「开放」仍被生成器绑着。prompt 从未在训练里出现过,能用但不能完美模仿。人类研究还报了操作延迟,分数对比不能当成严格的人机赛。
环境、奖励和规则语言全是封闭的。没有证据表明这套 in-context RL 能迁到真实机器人或开放文本指令。