微软 UniSteer:人类纠正微调 VLA,机器人 66 分钟学会拼豆
机器之心 · wechat · 2026-09-02
微软亚研院提出 UniSteer,通过将人类纠正动作反演为噪声空间监督,实现高效的 VLA(视觉-语言-动作模型)真机在线微调。该方法解决了流匹配架构下人类动作与噪声空间不兼容的问题,冻结预训练 VLA,仅训练轻量 noise actor。实验显示,在抓取、堆叠等四项任务中,UniSteer 平均 66 分钟将成功率从 20% 提升至 90%,仅需两条完整演示轨迹即完成高难度的拼豆任务。
「具身」频道最新
- Digimon AI 项目:PPO 训练中的奖励黑客问题与进展 — redfoxkiller · 2026-09-02
- Qwen-Drive-1.0: 统一感知与规划的自动驾驶基座 — Qwen · 2026-09-02
- ZimaBlue: 视频预训练进化出可泛化世界动作模型 — JoyFutureAcademy · 2026-09-02
- 卖方报告严重夸大机器人数据生成量 — zephyr_z9 · 2026-09-02
- Markov 机器人演示亚毫米级物体抓取,Zero-shot 泛化是物理 AGI 关键 — Scobleizer · 2026-09-02
- NVIDIA Warp 下载量破千万,官方直播讲解仿真与机器人工作流 — milesmacklin · 2026-09-02