Siemens 携手伯克利发布 ARLI:推理延迟下也能对 VLA 做 RL 微调

svlevine · x · 2026-09-22

Sergey Levine 团队与 Siemens 合作的 ARLI(Asynchronous RL with Intermediate Information)解决了异步推理破坏 RL 马尔可夫假设的问题。VLA 等大型通用策略推理延迟严重,会改变环境动力学,标准 RL 算法因此完全失效。ARLI 用小 RL 策略配合大机器人基础模型:小策略推理更快、能看到更新的图像,并通过两项设计在推理窗口内最大化反应性——用已提交动作和推理中途观测增强状态,恢复近马尔可夫结构,从而引导大策略走向更好行为。模拟与真实操作任务验证:在推理延迟下标准 RL 完全失败的场景,ARLI 能有效微调,甚至匹敌或超过理想零延迟下的标准 RL 表现。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →