斯坦福 Real-Time EXPO-FT 让 VLA 机器人实时操控
斯坦福 Perry Dong、Chelsea Finn 等人发布 Real-Time EXPO-FT,一个针对实时 VLA(视觉-语言-动作)策略的强化学习微调框架,解决预训练大模型推理缓慢、难以实时控制的问题。方法上通过两路拆分:异步路径由冻结的 VLA 持续生成候选动作块,配合另一路径实现低延迟响应,使原本缓慢的 VLA 模型可用于实时机器人操控,让机器人动作能实时追上物理世界。
2026-09-22 ~ 2026-09-24 · 2 条相关
- Real-Time EXPO-FT:异步拆分让慢速 VLA 实现实时操控 — philfung · 2026-09-22
- 斯坦福 Real-Time EXPO-FT:让 VLA 机器人实时追上物理世界 — StanfordAILab · 2026-09-24