看一段人类视频,机器人 29 秒学会新技能且不忘旧的

Robots Acquire Manipulation Skills in Seconds from a Single Human Video

Guangyan Chen, Meiling Wang, Te Cui, Zichen Zhou, Qi Shao, Shalfun Li, Hang Su, Roy Gan, Hao Wang, Mengyin Fu, Yi Yang, Yufeng Yue

cs.RO

2026-07-22

HOST 让机器人看一段人类视频,29 秒学会新技能,成功率 62%,超过 50 条示教微调的基线,且不遗忘旧技能。

这篇在解决什么

教机器人一个新技能,现在的标准流程又贵又慢又自毁。你得先用遥操作采集示教(占专家时间和稀缺的机器人机时),再离线微调几个小时,而参数更新会覆盖共享参数,把已经学会的技能带崩(灾难性遗忘)。教一个新动作,代价是忘掉一个旧动作。这篇要解决的是:能不能让机器人看一段人类干活的视频,在推理时几秒内学会新技能,同时保住已经会的。

难就难在人和机器人对不上。视频里是人手、特定视角、特定速度,机器人是另一副身体、另一个机位、另一套节奏。这种「结构失配」分三层:时间不同步(视频和机器人轨迹速度对不上)、状态不一致(embodiment、视角、外观都不同)、配对监督稀缺(同一段行为的人和机器人配对数据本来就少)。

方法

HOST 的核心是把视频从「被动条件信号」变成「主动驱动机器人预测的东西」。它靠两件事。

第一件是把预测目标耦合到视频上。它用 Smooth Dynamic Time Warping 把机器人轨迹和视频示教对齐到同一个「任务进度流形」上:用 Qwen3-VL-Embedding-8B 把帧编成向量,算相似度矩阵,再用前后向动态规划恢复单调的软匹配,训练时用时间循环一致性损失和 DTW 损失做自监督。这样每个预测目标都被重定义成对齐到视频的未来进展。

第二件是自扎根的预测级联,塞在一个自回归扩散模型里,分三步因果链走:

架构是搭在 Wan 视频扩散主干上的双专家 Mixture-of-Transformer:视频专家(负责定位和观测预测)加动作专家(降维的隐藏维度,负责动作生成)。训练分两阶段:先在 229 个任务的 19.4 万对同本体机器人-机器人配对上预训练,再用 5847 对人-机器人配做适配。

结果

50 个新操作任务、每个任务 20 次随机初始条件的实测:

指标HOST对照
学一个技能29 秒微调 4.0 小时(快 507 倍)
新任务成功率62%比零样本基线高 45 个点
对比 50 条示教微调62%Wall-OSS+SFT 56%
示教量1 条人类视频50 条(少 50 倍)

HOST 只用一条人类视频,成功率 62%,超过零样本基线(π0.5、Wall-OSS)45 个点,也超过用 50 条机器人示教微调的最强基线(Wall-OSS+SFT 的 56%)。比 π0.5+SFT 快 507 倍(它要 4.0 小时,HOST 29 秒)。

更关键的是不忘旧。在已经掌握的任务上,HOST 保持原性能,而微调方法集体崩盘:π0.5+SFT 只剩 20% 的原性能,Wall-OSS+SFT 保留 43%(已经是微调里最好的),HOST 比最好的微调保留率还高 56 个点。鲁棒性上,光照变化掉 1 个点、分布外物体掉 4、场景替换掉 6、执行中被人打扰掉 9,都在可接受范围。

为什么重要

对做机器人学习的人来说,这篇把「教新技能」从几小时级的离线训练拉到几十秒级的推理期获取,而且不用牺牲旧技能。这意味着一条人类视频就能扩库,不再被遥操作采集和灾难性遗忘卡脖子。思路也值得借鉴:它没有硬把视频翻译成动作,而是先把视频对齐成「任务进度」这个抽象,再让机器人沿着这个进度预测自己的未来,绕开了人-机形态差异这个死结。

局限与存疑

作者自己承认三点:只在单个双臂平台上验过,换一副差别很大的身体还没测;视频抓不到接触力,精细操作需要的触觉信息丢了(他们建议未来用触觉手套这类可穿戴传感器补);随着示教记忆变大,靠相似度检索可能分不开那些指令和场景只差一点点的任务。

还有一个存疑:50 个任务虽然在同类工作里算多,但都集中在双臂桌面操作这一窄类,「29 秒学会」这个数字在更长时序、更复杂的任务上还站不站得住没有给出。

术语

原文与代码

社区讨论

相关论文

全部论文解读