人类视频成机器人预训练底座:有效经验=小时数×每小时信息密度

rohanpaul_ai · x · 2026-09-22

Maxinsights 提出 Physical AI 数据缩放的新框架:人类第一视角视频已成为机器人操作技能的重要预训练素材,但只有在把人类经验「翻译」到机器人自身身体结构与运动方式后再训练,效果才显著更好。

核心观点是有效经验 ≈ 小时数 × 每小时信息量,主张沿两个耦合轴扩 Scaling:

引用的 Dyna-2(预训练于超 200 万小时人类第一视角视频)显示,模型随人类经验跨四个数量级单调提升,且能跨越身体差异(h embodiment gap)迁移到机器人数据——说明问题已不是「人类经验能否缩放物理智能」,而是百万小时之后该缩放什么。同样的时长,重复的桌面抓取与跨状态双臂操作,学习价值可差一个数量级。

所属事件:Maxinsights 发布 Physical AI 数据缩放定律报告(2 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →