3 万小时第一人称视频研究:数据加百倍,物体交互仍拉胯

arankomatsuzaki · x · 2026-10-10

CMU 等机构论文《What 30,000 Hours of Ego-centric Video Does Not Teach》用 3 万小时、1000+ 场景类型、1.4 万贡献者的自我中心视频数据,直接评估世界模型的智能体与物体交互保真度。

关键发现:

核心结论:单纯扩展第一人称视频数据已接近智能体建模极限,但模型如何影响世界的能力远未跟上——缩小差距取决于训练方式,而不只是数据量。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →