Reinforcement Learning for Real-Time Vision-Language-Action Policies
Perry Dong, Kuo-Han Hung, Dorsa Sadigh, Chelsea Finn
cs.RO, cs.LG
2026-09-16
斯坦福把慢VLA出块和快编辑策略拆开做实时强化学习。真机四项动态任务、在线数据封顶10分钟,平均成功率从42%(12.5/30)升到97%(29/30)。
大号 VLA(Vision-Language-Action,视觉-语言-动作模型)推理慢。机器人按 30 Hz 控频跑,等模型吐出动作时,当初那帧观测已经过时。观测过时造成分布偏移,动态任务里成功率会塌。
已有实时方案,比如 RTC(Real-Time Chunking,实时动作块推理),用动作补全让下一块在当前块还没跑完时就开始算。延迟能抹平,但这些方法基本是模仿学习,没法把策略推出训练分布、继续往高可靠走。把 RTC 当底座直接套强化学习,动作仍按旧观测生成,RL 能抠出来的可靠性吃不满。
斯坦福这组人在自己的 EXPO-FT 上改了一版,叫 Real-Time EXPO-FT。核心是把动作生成拆成两条时间尺度。
慢路径:预训练 VLA 异步出多条候选动作块。推理窗口里已经承诺要执行的前缀动作,按 Training-Time RTC 的方式 inpaint 进去当条件,块与块接得上。
快路径:轻量 edit policy(编辑策略)拿到最新观测,对每条候选的剩余动作做有界修正。Q 函数在「原候选 + 编辑后候选」里挑价值最高的一块立刻执行。
编辑量被限制在一个小区间里,Q 信号只回传到编辑网络,不灌回 VLA 骨干。大模型继续当行为先验,小网络负责对延迟窗口里发生的状态变化做即时反应。编辑后的策略在最新观测上是马尔可夫的,标准 RL 更新才站得住。
训练侧三件事一起做。VLA 用带前缀条件的 flow-matching 行为克隆:前缀当干净动作、后缀才加噪声,损失只算后缀。编辑策略最大化编辑后动作的 Q,再加熵正则。Critic 按整块动作做时间差分 backup。Backup 时对 VLA 采样很贵,所以先在噪声空间用轻量 critic 筛候选(沿用他们之前的 FASTER),只 decode 一次,再编辑、再按 Q 选。
实机底座是 π0.5,LoRA 微调(gemma2b 语言模型加 gemma300m 动作专家)。控制是末端笛卡尔速度加夹爪,30 Hz,侧视加腕部相机,图像 224×224。仿真不做 VLA,用 Kinetix 上预训练的状态版 flow-matching 策略,4 步推理延迟。上线前先用演示把 VLA 监督微调到大约 30% 成功率,再开始在线 RL;真机训练过程不插人手动纠错。
真机四项动态任务,在线数据封顶 10 分钟,每项评 30 次。VLA 本机推理大约 67 ms;托球、传球、射门再人为加 100 ms,总延迟大约 167 ms(d=5)。动态抓取只保留 67 ms(d=3),再加延迟基线会接近全灭。
| 方法 | 平均成功率 |
| SFT | 12.5/30 |
| SFT w/ RTC | 18/30 |
| RLPD | 4.5/30 |
| DSRL w/ RTC | 20/30 |
| EXPO-FT | 18.8/30 |
| EXPO-FT w/ RTC | 25/30 |
| Real-Time EXPO-FT | 29/30 |
分任务:动态抓取 30/30、传球 30/30、托球 28/30、桌上足球射门 28/30。后两项跑满 10 分钟;前两项提前打到 30/30。RLPD 这种轻量高斯策略在动态抓取和传球上是 0/30,没有预训练行为先验撑不住。SFT 平均 42%,新方法平均 97%。
仿真 Kinetix 10 个环境、4 步延迟、4 个种子各评 100 回合:Real-Time EXPO-FT 平均 96.2%,10 个环境都是延迟组最好。比 EXPO-FT w/ RTC 的 81.7% 高 14.5 个百分点,比 DSRL w/ RTC 的 76.1% 高 20.1 个百分点。零延迟的 RLPD 平均才 81.4%。延迟策略打赢了能看到当前状态的轻量 RL。
延迟从 0 扫到 4,RTC 往下掉,这套稳住。真机传球速度从 0.5× 加到 1.25×,成功率接近 100%;没有实时编辑的 EXPO-FT 会随速度掉。
VLA 的可靠性和实时性一直打架:模型越大越准,推理越慢,动态场景越吃亏。这篇给出一个能落地的拆法:大模型异步出块,小网络用最新观测改动作。10 分钟在线数据、训练不需要人介入纠错(reset 还是人做),对已经有预训练 VLA、任务能定义成功判定的实验室,跟进成本不高。
这是渐进改进,不是新范式。底座仍是 EXPO 加 RTC。但把 RL 的可靠性增益和实时执行叠在一起,之前的方法没做透。
作者自己写了两条:环境 reset 靠人;每项任务要单独做成功判定器,没比较过别的奖励形式。
还有几处要自己掂量。仿真用的是状态版 flow policy,不是真 VLA,延迟结论不能直接外推到视觉-语言模型。真机评测每项 30 次、单一种子,没有报告方差。在线预算按墙钟 10 分钟封顶,各方法实际环境步数并不对齐(传球大约 5k 步,其余大约 18k)。RLPD 和 DSRL 用异步高 UTD 更新,EXPO 系按 episode 更新,对照不对称,作者说这对基线更有利。编辑幅度是任务相关超参(射门 0.05,其余 0.1)。稀疏二值奖励加规则判定,换更开放的任务未必还能 10 分钟拉满。