机器人训练数据瓶颈:NVIDIA 丢弃 96% 视频,检索成新解法
AI Engineer · youtube · 2026-09-24
Bright Data 的 Rafael Levi 在 AI Engineer 播客中指出,物理 AI 的下一个瓶颈是找到对的训练视频:LLM 有数万亿词的语料,而机器人可用的动作视频只有约一百万条。
核心观点与数据:
- 雇人摆拍动作会产生偏差数据——被要求开门的人动作不自然;仿真和遥操作也难以规模化
- 网络上有数十亿小时真实人物操作物体、真实物理(重力、运动、因果)的视频
- 噪声是大问题:NVIDIA 训练 Cosmos 时丢弃约 96% 的下载视频,Stable Video Diffusion 丢弃 74%,浪费算力与存储
- 反例:Meta 用约 100 万小时公开视频加仅 62 小时真实机器人数据就实现了机器人控制
Bright Data 的方案是「先搜索、后采集」:按视频中的动作(而非标题)索引超过 10 亿条视频,通过 API 返回带时间戳、匹配得分和帧数的剪辑片段。演示了洗碗、叠衣等搜索场景,并延伸到自动驾驶、行车记录仪与品牌发现等用途。
「具身」频道最新
- 软体气动执行器改用 TPU-硅胶混合结构,行程提升 4 倍 — IanPritchard · 2026-09-25
- Waymo:2.71 亿英里无人驾驶,致伤事故比人类司机少 82% — reed · 2026-09-25
- HRI 2027 新设存档级工业白论文赛道,征集机器人落地实践 — petitegeek · 2026-09-25
- 高通 2nm 骁龙8至尊版发布:CPU 首破 5GHz,全线为智能体重写架构 — 量子位 · 2026-09-25
- Google 员工设想:用智能眼镜实时看见并「拍肩指挥」AI Agent — jason_mayes · 2026-09-25
- 用 iPhone LiDAR 做攀岩 3D 分析:开源视觉工具链解读 — dosco · 2026-09-25