Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills
Gaytri Jena, Kapil Wanaskar, Vinija Jain, Aman Chadha, Vasu Sharma, Amitava Das
cs.RO, cs.AI
2026-08-03
这篇综述沿「权重还是技能」给机器人学习分类,给代码派排出一条自改进阶梯,发现反馈、记忆、搜索三者合一的顶格只剩 3 个系统。
机器人学习现在有两条路在抢方向盘。一条是 vision-language-action(VLA)模型,把感知、语言理解和动作控制全压进一个大网络的权重里,靠堆数据和参数换泛化,代表是 RT-2、π0、Gemini Robotics。另一路让大模型当场写可执行的代码来控制机器人,代码还能在跑的过程中改、攒成技能库,代表是 Code-as-Policies 和 Voyager。
这两条路平时各做各的,谁也没把分界说清楚。更麻烦的是,「让机器人自己越用越聪明」这件事文献里说得很热闹,却没有一套公认的语言去度量它:哪个系统算「自我改进」、改进到什么程度,全靠各说各话。这篇综述(投稿 ACM Computing Surveys)要做的就是给这片混乱画一条线,按「能力烤进权重」还是「写成代码」给整个领域分类,再给代码这一派排出一条自改进的阶梯。
作者从 2016 年 1 月到 2026 年 7 月的文献里精选出 77 个放进分类体系的系统,外加 225 篇作为背景的「景观语料」,合计 302 个系统(算上 7 篇前人综述和 1 份产业资料,共 310 条引用)。77 这个数不是大杂烩,每个系统要过三关:能在「权重/技能」轴上确定位置、贡献了别的系统没有的新机制、原始论文信息全到能填满所有对比列。过不了的降级进背景语料。
分类的骨架是六大技术族:写代码的(code-as-policy)、烤权重的端到端 VLA、写奖励函数的(reward synthesis)、攒技能库的(skill libraries)、跨本体迁移的(sim-to-real)、以及评测基准。代码派额外按「自我改进程度」单独排了一条阶梯,这是全文最核心的贡献。这条阶梯由三个机制定义,作者给每个都下了可操作的定义,把边界争议钉死:
按这三个开关的有无,代码派被排成五级,越往上人越少。
这条自改进阶梯是一个清晰的漏斗(表 4,共 30 个系统):
| 阶梯 | 机制 | 系统数 | 代表 |
| 零样本合成 | 反馈/记忆/搜索全无 | 13 | Code-as-Policies、VoxPoser |
| 闭环自修复 | 有反馈,无记忆无搜索 | 6 | Inner Monologue、REFLECT |
| 技能库积累 | 有记忆 | 5 | Voyager、Uni-Skill |
| 进化式程序搜索 | 有反馈和搜索,无记忆 | 3 | CaP-X、RoboEvolve |
| 完整自改进环 | 三者全有 | 3 | ASPIRE、ENPIRE、RoboClaw |
最上面那一格,即反馈、记忆、搜索三者同时合进一个闭环,到 2026 年只有 ASPIRE、ENPIRE、RoboClaw 三个系统站上去,而且全是 2026 年的。综述反复强调,这条结构性观察比其中任何一个系统本身都重要:能力能随经验复利增长的「顶格」,是整片地图里最空、也最少被研究的一块。对照之下,VLA 那一派(11 个系统)全部标注为不自改进,能力在训练时就冻死,靠插值泛化,训完不能改、不能审、不能重组。
「技能」这个词被严重滥用是另一条线索。作者把文献里至少五种「技能」拎出来对比(表 5):从潜在策略(DIAYN)、到选项/原语(SPiRL)、到可读代码(Code-as-Policies)、到一键安装的机器人 App、再到商店里挂牌定价的商品。只有「代码」这一种同时做到可检查、可改写、可组合;而只有 App 和商品两种容易分发。能自迭代的和能上架的,正好错位。
族间对比里几个具体数字:Eureka 让大模型零样本写奖励函数,在 29 个 IsaacGym 任务上 83% 超过专家手写的奖励;Open X-Embodiment 把 21 家机构的 60 个数据集汇成超百万条轨迹、覆盖 22 种本体;CrossFormer 用一个 transformer 在 90 万条轨迹、20 种本体上匹配各本体的专用策略;RoboCat 最少 100 条示教就能适配新任务。但这些基准都只量「一次性成功率」,没有一套去画「成功率随自主交互次数上升」的曲线,而那恰恰是自改进阶梯要抬高的量。
这篇是综述和立场文,不提新方法,价值全在它给混乱命的名。对做机器人的人来说,「能力烤进权重还是写成代码」从此是个可以引用的分界;「自改进阶梯」把一个模糊的口号拆成了可度量的三级开关,谁说自己系统会自我改进,现在可以追问它占了哪几格。
更实在的是它把学术分类接上了已经在发生的商业现实。Unitree 的 UniStore 已经能一键下载跨机型的动作包,号称同一个技能跑在 G1、H1 人形和 B2、Go2 四足上。但综述点破:这些上架的技能全是「死回放」,装上去就照着播,根本不感知这个厨房、这个夹爪、这个物体跟录制时一不一样。阶梯里那些自修复、记忆、搜索机制,恰恰是让下载来的技能在现场适配所需要的;今天的商店只能算动画库,不是能力库。这中间的「静态到自适应」缺口,被作者点名为物理 AI 最该投的方向。
作者自己把边界交代得很清楚,这是体面之处。其一,这套自改进轴是刻意以代码为中心的,VLA 和强化学习技能发现被当成背景而非主角,换一个以表征学习或数据采集为中心的综述,地图会画得不一样。其二,顶格那三个系统都是 2026 年的、有的还是并发出来的,彼此基准数不可直接比,所以作者只做定性能力对比、不给排名。其三,「技能经济」这套框架目前只挂在一个厂商(Unitree)的商店上,是动机而非成熟结论。
读下来另有两处存疑。一是 77 个系统的入选靠「代表性与分析角色」的人工判断,「同一档只取最早或最承重的地标」这类规则难免带入挑选偏差,所以漏斗的数字反映的是覆盖范围,不是领域的真实产出比例,这点作者有声明,但读者容易当成绩单读。二是「代码派才是自改进正道」是个立场而非事实:VLA 那一派的迁移和泛化优势(百万级轨迹、跨本体)综述自己也承认,把它整体标成「不自改进」略像拿自己的尺子量别人。顶格三系统都太新,还谈不上经受过检验。