3 万小时第一人称视频研究:数据加百倍,物体交互仍拉胯
arankomatsuzaki · x · 2026-10-10
CMU 等机构论文《What 30,000 Hours of Ego-centric Video Does Not Teach》用 3 万小时、1000+ 场景类型、1.4 万贡献者的自我中心视频数据,直接评估世界模型的智能体与物体交互保真度。
关键发现:
- 训练数据增加 100 倍,智能体建模改善明显,但物体交互保真度始终远低于智能体建模,且提升缓慢;
- 精心设计的视觉条件化(visual conditioning)只需一小部分数据即可让智能体建模饱和,从而单独度量物体保真度并找到其饱和点;
- 提出将模型容量从场景外观转向物体动力学的监督方案,虽有实质改善但差距仍存;
- 结论可迁移至下游人形机器人建模。
核心结论:单纯扩展第一人称视频数据已接近智能体建模极限,但模型如何影响世界的能力远未跟上——缩小差距取决于训练方式,而不只是数据量。
「具身」频道最新
- Starkey 发布 Omega AI+ 助听器:G4 生成式 AI 处理器加四路 DNN — BrandonSawalich · 2026-10-10
- Wayve 创始人晒与 Stellantis 合作的 AI 驾驶穿行都灵街头 — alexgkendall · 2026-10-10
- 192GB 版 Framework Desktop 第二批已售罄 — film_girl · 2026-10-10
- Danu Robotics 创始人六年磨一剑,只为造出更好的垃圾分类机器人 — TechCrunch AI · 2026-10-10
- NVIDIA 基于 GR00T 发布 SSD 拾取机器人部署模型 — _akhaliq · 2026-10-10
- Success-Guided Sampling:纯仿真 RL 零样本实现精细机械臂装配 — kevin_zakka · 2026-10-10