Siemens 携手伯克利发布 ARLI:推理延迟下也能对 VLA 做 RL 微调
svlevine · x · 2026-09-22
Sergey Levine 团队与 Siemens 合作的 ARLI(Asynchronous RL with Intermediate Information)解决了异步推理破坏 RL 马尔可夫假设的问题。VLA 等大型通用策略推理延迟严重,会改变环境动力学,标准 RL 算法因此完全失效。ARLI 用小 RL 策略配合大机器人基础模型:小策略推理更快、能看到更新的图像,并通过两项设计在推理窗口内最大化反应性——用已提交动作和推理中途观测增强状态,恢复近马尔可夫结构,从而引导大策略走向更好行为。模拟与真实操作任务验证:在推理延迟下标准 RL 完全失败的场景,ARLI 能有效微调,甚至匹敌或超过理想零延迟下的标准 RL 表现。
「具身」频道最新
- Figure 发布 Helix 2.5,人形机器人零样本搞定 30 套陌生住宅 — FinanceYF5 · 2026-09-22
- Figure 发布 Helix 2.5,租 30 套住宅零样本测家务 — FinanceYF5 · 2026-09-22
- PrimeBOT T1 售价19999元起,产线每2.5分钟下线一台人形机器人 — davidpattersonx · 2026-09-22
- RoboDawn:用 VLM 加离散指令闭环控制机器人,零样本胜 π0.5 — Meng-Hao Guo · 2026-09-22
- HuRo 数据集:63 万条人类视频机器人化样本,VLA 预训练完成率 51.5%→80.3% — RLWRLD · 2026-09-22
- 嫌弃 5 万美元商用转运车太贵,工程师自改扭扭车造 Robocart — uavbro · 2026-09-22