MSRA 等发布 UniSteer:人类纠错可注入 flow-matching VLA 的强化学习
jiqizhixin · x · 2026-09-11
微软亚洲研究院、悉尼科技大学与清华大学提出 UniSteer,解决真机强化学习中人类引导与轻量 RL 之间的接口问题。
- 真机 RL 盲探索成本极高,自然方案是人类引导;但 flow-matching VLA 的 RL 优化对象是初始噪声,人类知道机械臂该怎么动,却无法直接把自己的动作映射到噪声空间。
- UniSteer 通过近似的 action-to-noise inversion,把人类接管时的纠正动作反演为目标噪声,打通了这一接口。
- 纠正数据同时进入两个缓冲区:演示缓冲区用于对 actor 做直接 MSE 监督,RL 缓冲区帮助 critic 学习这些高价值的状态-噪声对;监督与强化学习共同更新同一个轻量噪声 actor,而预训练 VLA 的骨干保持不变。
「具身」频道最新
- Masked Mimic 新增摇杆控制模式,机器人动作实时跟随 — carlosdponx · 2026-09-11
- OpenAI Astra 展示机器人移动操作视频上下文学习能力 — npew · 2026-09-11
- Actor Labs 联手 Physical Intelligence 办 36 小时实体 AI 黑客松 — Darpinian · 2026-09-11
- 家用机器人远程求助时,谁来监控你的摄像头画面? — VraserX · 2026-09-11
- NVIDIA 详解全栈 robotaxi 方案:市场2035年将达4000亿美元 — nvidia · 2026-09-11
- 特斯拉 Cybercab 窄路谨慎避让骑行者,自动驾驶安全性引关注 — EricETesla · 2026-09-11