WING 框架:从人类第一视角视频学机器人操作,LIBERO 成功率 99.2%
hongkongust · hf · 2026-10-07
港科大(广州)团队提出 WING(World Action Learning via INteraction-Centric Spectral Latent Guidance),解决从人类自我中心视频(egocentric video)向机器人策略迁移交互知识的难题。
- 问题:直接从视频帧重建推断潜在动作,容易被自我相机运动等干扰因素主导;人类与机器人行为的时间动态也不同。
- 方法:WING 先分离观察者运动与手-物交互,把交互相关成分蒸馏为潜在动作;再利用跨具身任务语义集中在慢变时间结构这一观察,在频谱域识别自我中心潜在动作与机器人行为的共享低频分量,用其引导动作生成。
- 结果:LIBERO 平均成功率 99.20%,RoboTwin 2.0 达 93.80%,RoboCasa-GR1 达 57.7%,并在四项真实世界操作任务上表现强劲。
「具身」频道最新
- Generalist 机器人底盘模型复现拆装液压杆 O 型圈,秒级示教学新任务 — 141_1337 · 2026-10-07
- YC 新公司 Vexo 推常听 AI 手环:免重复交代上下文直接干活 — ycombinator · 2026-10-07
- LeCun 团队发布 H-JEPA:分层世界模型视觉规划成功率 18%→73% — ylecun · 2026-10-07
- DiVeR:只在决策关键状态训练验证器,提升 VLA 测试时扩展 — SharonYixuanLi · 2026-10-07
- 百万英里老司机参观 Tesla Semi 工厂:这个行业将被改变 — elonmusk · 2026-10-07
- Attacca:让具身智能体在 Minecraft 长程任务上完成率提升至 7 倍 — nanyang-technological-university-singapore · 2026-10-07