Dyna-2 用 100 万小时第一视角视频训练,公开数据基建细节

Scobleizer · x · 2026-08-19

机器人公司 Dyna 发文公开 Dyna-2 的训练数据基建:基于 100 万小时以上第一视角视频,并指出万小时规模下有效的做法到百万小时全部失效——数据摄取吞吐卡在每周 1.4 万小时(百万小时要跑一年多)、构建训练 manifest 需 48 小时才能开跑、训练时从云存储读 1PB 数据会让 GPU 暴露在延迟与丢包风险下。

转发者(YC 团队 kstonekuan)称该文是多模态机器人数据规模化处理的金矿,并开源了文中所述数据基建的参考实现 HFlow:Airflow 做 DAG 编排、MCAP 存储机器人 episode 并支持随机访问、DuckDB 在列式元数据上做分析查询与数据集筛选。他们过去两个月在 YC 做帮助机器人团队搜索、分析、评估数据质量的 API,核心体会是「规模化后 AI 问题变成软件工程问题,优化一处瓶颈就转移到下一处」。

所属事件:Dyna Robotics 复盘百万小时视频训练 Dyna-2 的基础设施(9 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →