FlowDAgger:机器人靠纠正学习
oier_mees · x · 2026-07-16
核心结论
作者提出 FlowDAgger:不要直接微调机器人基础模型,而是利用人类纠正动作来学习如何“ steer ”已冻结的策略。
关键方法
- 现代 VLA / world-action 模型在新机器人和新任务上适应很难
- 传统做法是在线模仿学习或再训练,但在小数据下容易破坏原有能力
- FlowDAgger 用 action inversion,把人类纠正动作映射回冻结生成策略的潜在噪声空间
- 再用这些潜在目标训练一个轻量控制器,完成部署期适配,同时不改底座模型
结果
- 只需要 5–20 次 人类介入就能学习
- 在模拟和真机上都优于监督微调和潜空间强化学习
- 可用于 VLA、diffusion policies、world-action models
- 在不修改预训练策略的前提下带来稳定改进
其他信息
项目由 Microsoft Research 与 University of Washington 团队合作完成,附有论文、项目页和代码。
所属事件:FlowDAgger:用人类纠正数据适配机器人模型(2 条相关)→
「具身」频道最新
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11
- 狗类 3D 姿态数据集发布,动物动捕研究可用 — ducha_aiki · 2026-09-11
- Swaayatt 演示山区高速自动驾驶:52km/h 过盲弯失控后自稳 — sanjeevs_iitr · 2026-09-11
- AUAR 推移动微型工厂:为每块木板定制生成机器人加工方案 — lukas_m_ziegler · 2026-09-11