微软 UniSteer:人类纠正微调 VLA,机器人 66 分钟学会拼豆

机器之心 · wechat · 2026-09-02

微软亚研院提出 UniSteer,通过将人类纠正动作反演为噪声空间监督,实现高效的 VLA(视觉-语言-动作模型)真机在线微调。该方法解决了流匹配架构下人类动作与噪声空间不兼容的问题,冻结预训练 VLA,仅训练轻量 noise actor。实验显示,在抓取、堆叠等四项任务中,UniSteer 平均 66 分钟将成功率从 20% 提升至 90%,仅需两条完整演示轨迹即完成高难度的拼豆任务。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →