机器人 AI 现状:VLA 快慢双系统,缺的是机上持续学习
PTrubey · x · 2026-09-27
主流设计趋同
Figure 的 Helix、Physical Intelligence 的 π0、Google DeepMind 的 Gemini Robotics 都采用视觉-语言-动作(VLA)模型:慢速「思考」层(多模态 LLM)理解指令、观察场景、规划步骤;独立的快速控制层每秒多次输出电机指令。机器人能对话、拆解「清理厨房」这类任务、发现抓取失败并重试。
训练方式
主要靠人类演示的模仿学习(遥操作 + 第一/第三人称视频),叠加强化学习——运动技能多在仿真中训练,精细技能越来越多在真实世界微调。
应对错误的三种机制
- 上下文内适应:慢层看到「杯子滑了、抽屉卡住」就重新规划,适合推理类问题,但不是永久学习
- 车队级离线重训:像 Tesla FSD 一样数周推送更新,所有机器人共享彼此的失败经验
- 外挂记忆系统:记住「这家的锅在左边柜子」等个性化信息
缺失的一环
上下文适应对推理有效、对运动技能无效。人类摸三次就能掌握陌生工具,因为运动系统真的在重塑;现在的机器人无法把几次尝试固化成新技能,只能等下次车队重训。对单站点、单机体的稀有局部问题(某个僵硬抽屉、磨损的夹爪)尤其无解——作者吐槽自己的 Tesla 总在同一个路面凹陷处开太快。
机上持续学习能否实现、是否重要,是当前 AI 机器人领域的万亿美元问题。
「具身」频道最新
- 特斯拉9月启动新一轮中国供应链审厂,Optimus 量产加速 — pstAsiatech · 2026-09-27
- 马斯克预言:10 年内 10 亿台人形机器人,AI 2030 超全人类智能 — XFreeze · 2026-09-27
- 「iPhone 已不是电话而是口袋电脑」,换机争论再起 — jesselyu · 2026-09-27
- Waymo 最新安全数据:2.7 亿英里重伤事故率比人类司机低 20 倍 — SumitGup · 2026-09-27
- whurley 组装林肯市首台 Reachy Mini 桌面机器人 — whurley · 2026-09-27
- VSArena 开源基准:让 AI 智能体在交互式 3D 环境中接受评测 — NovaCoding · 2026-09-27