机器人策略用 4 小时离域数据,反超同域数据表现

DominiqueCAPaul · x · 2026-07-27

作者分享了一个意外的机器人训练结果:在 lightbox 评测里,用来自 5 张桌子、2 个工作站 的 4 小时 多样化数据训练出的策略,竟然打败了同样时长、但数据全部来自 lightbox 内部的策略。

核心结论是:多样化的离域数据,反而在同域评测上赢过同域数据。作者说自己原本以为超参数会带来更大差异,但实际影响更大的,是数据采集方式。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →