人类视频成机器人预训练底座:有效经验=小时数×每小时信息密度
rohanpaul_ai · x · 2026-09-22
Maxinsights 提出 Physical AI 数据缩放的新框架:人类第一视角视频已成为机器人操作技能的重要预训练素材,但只有在把人类经验「翻译」到机器人自身身体结构与运动方式后再训练,效果才显著更好。
核心观点是有效经验 ≈ 小时数 × 每小时信息量,主张沿两个耦合轴扩 Scaling:
- Experience Scale(经验规模):录了多少小时的人类活动;
- Experience Density(经验密度):每段录像能揭示多少物体状态、手部/身体运动、接触力、几何、时序与工具使用等物理信息。
引用的 Dyna-2(预训练于超 200 万小时人类第一视角视频)显示,模型随人类经验跨四个数量级单调提升,且能跨越身体差异(h embodiment gap)迁移到机器人数据——说明问题已不是「人类经验能否缩放物理智能」,而是百万小时之后该缩放什么。同样的时长,重复的桌面抓取与跨状态双臂操作,学习价值可差一个数量级。
所属事件:Maxinsights 发布 Physical AI 数据缩放定律报告(2 条相关)→
「具身」频道最新
- Snap Specs 卖 2195 美元撞上 1999 美元折叠 iPhone,时机堪忧 — adariostrange · 2026-09-22
- 华为 MateBook Fold 实测:13 寸笔记本展开成 18 寸 3.3K OLED — anthara_ai · 2026-09-22
- 让两大前沿模型操纵真实机器人玩夺旗,Gemini 以 70% 胜率碾压对手 — chris_j_paxton · 2026-09-22
- 网友畅想 Ray-Ban 眼镜接入 Meta Muse:或成消费级 AI 最佳应用 — ChrisUniverse · 2026-09-22
- 约翰霍普金斯将在 IROS 2026 办可扩展触觉灵巧操作工作坊 — _krishna_murthy · 2026-09-22
- KAIST 提出无结构单目 VIO 初始化法 SLIM-init,入选 IROS 2026 — zhenjun_zhao · 2026-09-22