机器人 AI 现状:VLA 快慢双系统,缺的是机上持续学习

PTrubey · x · 2026-09-27

主流设计趋同

Figure 的 Helix、Physical Intelligence 的 π0、Google DeepMind 的 Gemini Robotics 都采用视觉-语言-动作(VLA)模型:慢速「思考」层(多模态 LLM)理解指令、观察场景、规划步骤;独立的快速控制层每秒多次输出电机指令。机器人能对话、拆解「清理厨房」这类任务、发现抓取失败并重试。

训练方式

主要靠人类演示的模仿学习(遥操作 + 第一/第三人称视频),叠加强化学习——运动技能多在仿真中训练,精细技能越来越多在真实世界微调。

应对错误的三种机制

缺失的一环

上下文适应对推理有效、对运动技能无效。人类摸三次就能掌握陌生工具,因为运动系统真的在重塑;现在的机器人无法把几次尝试固化成新技能,只能等下次车队重训。对单站点、单机体的稀有局部问题(某个僵硬抽屉、磨损的夹爪)尤其无解——作者吐槽自己的 Tesla 总在同一个路面凹陷处开太快。

机上持续学习能否实现、是否重要,是当前 AI 机器人领域的万亿美元问题。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →