伯克利提出 CLIFT 法,闭源模型也能闭环微调人形机器人
keerthanpg · x · 2026-08-20
UC Berkeley 联合 Google DeepMind 和 NVIDIA 发布论文《CLIFT》,提出了一种无需访问模型内部参数(梯度、损失)的闭环迭代微调方法。
背景与痛点:
- 闭源机器人基础模型(如 Gemini Robotics On-Device)虽是通才,但在敏捷、接触丰富的人形任务上常因分布偏移而缺乏任务掌握能力。
- 掌握任务需要闭环学习,但闭源模型仅提供 SFT API,无法进行标准的强化学习(如 PPO)。
核心方法:
- 研究者发现强化信号可以直接编码到监督训练数据中。
- 仅通过 SFT API 这一黑盒接口,利用观测-指令-动作块元组进行微调,即可实现类似 RL 的策略提升,无需修改模型或训练过程。
结果:
- 该方法成功将基于开源 Gemma 的小型端侧模型转化为人形任务专家,在操作任务上击败了部分最大的行动模型。
「具身」频道最新
- 七个月参数暴涨千倍:谷歌 RT-1 仅 5500 万,RT-2 达 550 亿 — binarybits · 2026-08-20
- Perceptron Inc 发布SotA具身VLA模型,将感知与控制统一训练 — code_star · 2026-08-20
- 把10欧元玩具改造成LLM机器人,作者公开完整改造流程 — calabi_and_yau · 2026-08-20
- 远程部署突破:实现 4000 英里外控制机器人 — StewartalsopIII · 2026-08-20
- GeneralistAI 发布 GEN-1.5:演示单样本学习机器人任务 — teortaxesTex · 2026-08-20
- Wired 现场:机器人即兴用香蕉当工具完成任务 — nordicinst · 2026-08-20