Zero-WAM:给机器人看人类视频,零样本学会没见过的任务
ZeYanjie · x · 2026-08-29
核心问题
机器人能否像 LLM 那样做上下文学习(ICL),执行训练时从未见过的任务?Junwei Liang 等人提出的 Zero-WAM 给出肯定答案:把一段人类操作视频当作 prompt,为机器人指明操作对象、方式与顺序。
关键组件
- HumanGen 数据管线:把任务采样的机器人轨迹自动转换为语义匹配的人类示范,构建出覆盖 8.6K 任务的 74.2K 人-机器人配对数据,解决任务丰富配对数据稀缺的问题。
- 模型:一个因果视频-动作模型,跟随上下文中的人类视频指引执行未见任务。
- IFP 目标(in-context future chunk prediction):抑制从已见任务学到的捷径,迫使策略从视频 prompt 中提取任务信息。
结果
在 7 个未见任务上取得 46.95% 零样本成功率,比 Lingbot-VA 高出 29.5 个百分点。论文、项目页与代码均已公开。
所属事件:Zero-WAM:机器人看人类视频即零样本学新任务(5 条相关)→
「具身」频道最新
- SPECS 智能眼镜演示空间射击游戏 Core Boom — TinfoilTricorn · 2026-09-23
- 西非首例远程机器人手术:外科医生在尼日利亚跨城操刀 — Fowe · 2026-09-23
- 2025 年全球人形机器人销量仅约 7000 台,量产叙事仍远未兑现 — VraserX · 2026-09-23
- 宇树 H2 人形机器人摔倒如不倒翁,顽强爬起萌翻网友 — CyberRobooo · 2026-09-23
- GPT-6 实测 LIBERO 机械臂任务:能开灶台,抓不住摩卡壶 — YuXiang_IRVL · 2026-09-23
- OpenRoboto Shift 发布:众包第一视角视频训练人形机器人大脑 — markjeffrey · 2026-09-23