LingBot-Video训练机制:六维物理奖励与真实机器人数据

thetripathi58 · x · 2026-07-09

LingBot-Video改变了传统视频模型仅追求视觉美观的打分机制,采用单步GRPO算法,引入视觉质量、图文对齐、动态程度、运动连贯性、人类动作一致性和物理合理性这6个精确奖励信号,确保模型能理解真实物理规律。

为避免模型“伪造”物理效果,团队使用了超过7万小时的真实机器人数据(包含人形和四足机器人的真实手部操作、行走轨迹和第一人称视角)进行训练。

所属事件:蚂蚁开源具身视频模型 LingBot-Video(26 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →