斯坦福 Mulligan:瞄准失败初始状态采数据,2550 次盲评超越均匀采集

ZhaoMandi · x · 2026-10-10

斯坦福团队(含 Shuran Song、Chelsea Finn)发布 Mulligan 项目,研究如何让机器人学习可扩展——在部署中边干边学,高效利用仍需的人类协助。

核心方法:性能引导的数据采集。每轮部署中机器人在真实环境执行高精度操作任务,失败时由操作员介入纠正;下一轮将采集集中在初始状态分布中策略仍失败的部分,而非均匀随机采集——因为随着策略进步,失败会集中在少数初始状态,均匀采集大多落在已能成功的场景,浪费操作员时间。

在 3 个真实任务上、共 2550 次严格盲评(协议保证统计严谨性)中,同等操作员预算下 Mulligan 显著优于均匀采集。论文、代码与数据均已公开。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →