长程任务零训练,冻结技能把成功率从2.0%抬到56.3%

Skill2Real: Agentic Skill Learning for Zero-Shot Sim-to-Real Robot Manipulation

Xincheng He, Siyu Ma, Chang Yu, Yunuo Chen, Yanjia Huang, Ying Nian Wu, Yin Yang, Chenfanfu Jiang

cs.RO

2026-10-02

Skill2Real 在仿真里用特权反馈学完两级技能并冻结,不再做真机训练,把未见过的长程成功率从 2.0% 抬到 56.3%,四任务真机完成率 78.75%。

这篇在解决什么

零样本 sim-to-real 要的是:仿真里的操作经验,不采集真机任务数据,就能在物理机器人上执行。外观、接触、动力学和本体对不齐,长程任务还得把局部动作串起来,中间失败了要能改计划。

域随机化把预算花在光照和纹理上,可复用的操作知识长不出来。Code as Policies 能写可执行程序,调用的是人事先准备的原子技能,并不从回合里学会怎么抓、怎么放。已有技能库又多半靠人工或真机反馈往里添程序。

模拟器里的物体真值和接触结果不该写进最终策略。学习可以看特权信息,存下来的技能只能靠两边都有的公开观测和 API 语义。

方法

Skill2Real 迁过去的是技能文本,不是权重。仿真与真机共用一套代码接口:观测和操作的语义一致,感知、标定、关节控制由各自后端实现。策略采样程序时只看语言目标、历史观测、接口文档和两级记忆。这层接口就是迁移边界。

三个 LLM 组成 PVG。Proposer 只用公开观测和 API 返回写程序、提议更新,部署阶段只留这个角色。Verifier 能读特权轨迹,输出却只能使用公开观测和 API 语义。Governor 用与训练种子不相交的回合复查候选,看完成、失败和有没有退步,每个候选复查 25 次。

两级记忆顺序训练,循环相同。Cerebellum 从空记忆学局部技能:何时使用的说明、API 调用模板、一份轻量状态。学完冻结。Brain 另起空记忆,只负责选目标、排序和失败后的改计划,不能改小脑。碗放托盘的记录里,程序成功后四条候选只收下一则「按当前图像最左中心选碗」;接触几何属于小脑,没做实验的进度检查被拒。

公开 API 有 18 个操作,覆盖取图、立体深度、框内分割、几何测量和位姿编译。策略拿不到真值位姿和成功标签。小脑 3 轮、大脑 4 轮,C3 之后小脑冻结。每轮每任务 5 条训练回合:LIBERO-90 共 3150 条,七个 Robosuite 任务共 245 条。训练时三角色同一模型,推理力度 medium。评测可以换 Proposer,Verifier 和 Governor 不参与。

结果

Sol 在 LIBERO-90 上训练,冻结检查点由 GPT-6 Astra 在 LIBERO-Pro Long 上评测:20 任务×10 种子,目标集不参与训练,也不改记忆。Opus 5 使用同一评测协议。

设置指标结果
Astra,空记忆 / 仅小脑 / 全层级Pro Long 总成功率2.0% / 35.3% / 56.3%
Opus 5,同一协议Pro Long 总成功率0.5% / 29.3% / 49.0%
Astra,B4指令扰动 / 位置扰动76.0% / 36.5%
Opus 5,B4指令扰动 / 位置扰动66.5% / 31.5%
Sol,Robosuite 七任务从零训练平均成功率16.6% → 45.6% → 85.1%
Opus 5,Robosuite平均成功率19.4% → 49.6% → 89.4%
Astra,UR5e,每方法每任务 20 次四任务平均完成率空记忆 27.50%,仅大脑 37.50%,仅小脑 56.25%,全层级 78.75%
训练时去掉 Verifier / GovernorPro Long 的 B439.0% / 43.0%,全系统 56.3%

Astra 的路径是 2.0%、35.3%、56.3%,大脑在冻结小脑上贡献 21.0 个百分点;Opus 5 为 0.5%、29.3%、49.0%,大脑贡献 19.8 个百分点。B4 上位置扰动明显更低:Astra 是 36.5% 对指令扰动 76.0%,Opus 5 是 31.5% 对 66.5%。Robosuite 从零另训,Sol 七任务平均从 16.6% 到 85.1%,Opus 5 从 19.4% 到 89.4%,大脑阶段再加 39.6 和 39.9 个百分点,七个任务都涨。LIBERO 本身基于 Robosuite,这里不是换物理引擎。罐头、牛奶盒、麦片盒三项没有进入平均。

真机 UR5e 加 Pika 夹爪,用的是 Sol 在 LIBERO-90 上学到的 C3/B3,无示教、无微调、无在线更新。全层级四项为 95%、85%、85%、50%,平均 78.75%;仅小脑 56.25%,仅大脑 37.50%,空记忆 27.50%,CaP-Agent0 为 11.25%。抽屉只有全层级完成过。

对外比较用的是另一份 C3/B3:10 任务,每种扰动 20 次。Astra 总成功率 55.3%,指令扰动 75.0%,位置扰动 35.5%;Zetta 为 51.5%、63.0%、40.0%,位置扰动更高。换 Opus 4.6 降到 35.3%,仍高于 ASPIRE 的 30.5%。碗进抽屉、书进收纳格这类窄空间,代码接口不如端到端策略紧。源套件 LIBERO-90 上,Sol 最终 62.0%,Opus 5 为 73.3%;去掉 Verifier 或 Governor 后,Sol 的源套件掉到 38.0% 和 40.0%。

为什么重要

学习预算花在可执行的任务程序上。库冻结之后换 Proposer 不用重训,Sol 写下的记忆交给 Astra、Opus 5 和 Opus 4.6,涨幅方向一致。增益主要来自写进记忆的程序。

部署只要求后端实现同一 API。仿真是 Franka,真机是 UR5e,平均完成率仍从 27.50% 到 78.75%。把抽屉打开、放入再关上,只有全层级做过。窄空间的位置扰动上,它仍然落后 Zetta 所套的端到端控制。论文给出的下一步,是把端到端策略收成可调用工具,并缩短 VLM 延迟。

局限与存疑

56.3% 与 55.3% 协议不同:前者 20 任务×10 种子直到 B4,后者是 C3/B3 的 10 任务×20 次。ASPIRE 一次生成、种子 1–50、不再调试;CaP-Agent0 允许测试时重试;Zetta 用 50 个开发种子在 π0.5 外演化,再评 20 个留出种子。差三四个点,排不了名。

从小脑到大脑,多出来的不只是层级,还有额外训练轮次。附录写明曲线按迭代走,不按累计回合。成功率是单库点估计,未见多次独立训练的方差。无 Verifier 的对照缺少一个只读公开观测的 Verifier,17.3 个百分点没有把特权信息单独量出来。

真机四种任务、每格 20 次。桌布和光照变化没有分条件成功率,暗光例子在等式判定前结束。真机侧没有 Verifier,费用和延迟未报。技能由闭源模型在 medium 推理力度下写成。开源模型是否还能达到 56.3% 和 78.75%,没有验证。

术语

原文与代码

相关论文

全部论文解读