斯坦福新法解决 VLA 推理延迟:10 分钟数据把成功率从 42% 提到 97%
burny_tech · x · 2026-09-21
斯坦福 Chelsea Finn、Dorsa Sadigh 团队发布论文《Reinforcement Learning for Real-Time Vision-Language-Action Policies》,直击 VLA 模型做实时机器人控制的核心痛点:模型太大导致推理延迟高,执行动作时观测早已过期,形成分布偏移、可靠性大降。
核心思路
- 解耦「慢而强」与「快而reactive」:大型预训练 VLA 在后台慢速提出动作块(action chunks),提供强行为先验;
- 一个轻量级 RL 策略基于最新观测,实时对动作进行编辑与选择,弥补延迟造成的观测滞后;
- 构建在 EXPO-FT 框架之上,称为 Real-Time EXPO-FT,首次让 RL 微调满足动态真实操控的实时控制要求。
效果
- Kinetix 基准上,带延迟的策略在全部 10 个环境中超过所有非延迟方法;
- 四个动态真实任务(传递物体、平衡球、桌上足球、抓取动态物体)中,在线机器人数据仅 10 分钟,平均成功率从 42% 提升到 97%。
「具身」频道最新
- 反偷拍应用 ZuckOff 走红:靠蓝牙指纹识别身边 Meta 智能眼镜 — LexiLove · 2026-09-21
- CVPR 2026 论文 GaME:让机器人 3D 地图学会遗忘过时几何 — lucacarlone1 · 2026-09-21
- 160 公斤硬拉实拍:LUDUS 展示惊人力量演示 — AIFlow_ML · 2026-09-21
- DeformSmith:物理引导分层生成可变形资产,服务机器人操作 — Can Li · 2026-09-21
- 累计落地超万台机器人,酷哇科技拆解端侧世界模型 COOWAM 架构 — 创业邦 · 2026-09-21
- 特斯拉得州 Optimus 产线主体结构近完工,启元机器人 2.5 分钟下线一台 — 创业邦 · 2026-09-21