掩码视觉动作让视频动作模型跨机身泛化,甚至能覆盖猩猩

CSProfKGD · x · 2026-07-25

一条机器人线程称,视频-动作模型已经成为通用机器人方向的 SOTA,关键推进来自 RhodaAI 的 Direct Video-Action Model。

帖文重点介绍了一个新思路:用 masked visual actions 让视频动作模型更省数据、也更少依赖具体机身。引用内容称,团队只用 15 小时单臂机器人视频 训练了一个 video world model,就能 zero-shot 泛化到未见过的机身,甚至包括 orangutans;模型还能根据“你希望物体如何运动”去合成对应的机器人动作。

所属事件:仅用 15 小时视频训练出零样本机器人世界模型(3 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →