$π\mathbf{R}^2$: Reactive Real-time Flow Policies
Sungjae Park, Shubham Tulsiani
cs.RO, cs.AI, cs.LG
2026-07-29
πR² 给基于大骨架的动作分块流匹配策略加两条改动:本体感知做每 tick 刷新的快通道、视觉语言做异步慢通道,再用延迟自适应调度每调用只走一步去噪。在 GR00T-N1.7 上重规划提速约 4 倍到 25Hz,仿真和真机成功率最高涨 23%、30%。
现在的通用操作策略越来越多是「动作分块」的流匹配策略,建在大预训练骨架上。这类策略一次吐出一整段动作,然后开环执行,执行中途来了新的感官输入,策略反应不了,牺牲了反应性。
想靠更频繁地重规划来恢复反应性,但感知到动作的管线(大骨架加多步去噪)太慢。比如 GR00T-N1.7 每次调用约 140ms(50Hz 下约 7 个控制 tick),逼得机器人只能锁定一长段动作。延迟让频繁重规划变得不可行,已提交的动作也变得过时。这类策略因此不适合动态、闭环的控制。
πR² 在基于扩散强制(diffusion forcing)的每位置噪声调度之上,加两条正交改动,既能实时反应,又保留大骨架、多模态、多动作预测。
第一条,把条件分成两个异步更新的通道。快通道是本体感知(proprioception,关节位置、速度、力矩、接触力),每个 tick 都刷新;慢通道是视觉语言特征,在后台线程异步更新。道理是:本体感知的获取比图像和文本快好几个量级,而动态任务里,局部反应性修正所需的信息本体感知就够,视觉语言只提供全局上下文。这样策略在一个动作块内就能对本体力矩做反应,同时容忍视觉是旧的。
第二条,延迟自适应的流调度。用参数化的每位置噪声「阶梯」处理推理延迟 d:块前段 [0,d) 把在飞动作钉成干净状态作为 inpainting 条件,中段线性从干净过渡到噪声,尾段是纯噪声。每次调用滑窗 d 个位置,一步去噪就吐出 d 个干净动作。一个训练好的模型能适配当次实测的硬件延迟。
整套东西对现有架构改动极小:DiT 的 AdaLN 条件从共享变成每位置一组参数,一行改动就能从预训练策略微调,不动骨架。
用在 GR00T-N1.7 上,真机 xArm6 加 XHand 平台:
| 指标 | 结果 |
| 闭环重规划速度 | 比基座快约 4 倍,A5000 上约 25Hz |
| 观测刷新间隔 | 每 40ms 一次新观测 |
| 仿真成功率 | 比最强基线最高 +23% |
| 真机成功率 | 比最强基线最高 +30% |
真机四个任务里 πR² 全面领先最强基线(Train-Time RTC):Don't Spill 10/20 对 4/20,Tidy Up Book 12/20 对 4/20,Insert Box 16/20 对 11/20,Catch Book 11/20 对 4/20。
反应性的直接证据:πR² 能根据实时力反馈调握力,约 50N 就停;Train-Time RTC 反应慢半拍,冲到约 120N,把书捏坏。
这篇解决的是机器人 VLA(视觉语言动作模型)落地的一个硬约束:大骨架带来的高延迟让策略没法做高频闭环。它没换骨架、没牺牲多模态表达,只靠快慢通道分流加延迟自适应调度,就把控制频率拉到 25Hz。这意味着原本只能开环执行的重策略,现在能做接触丰富的动态任务,比如倒水不洒、接住物体。
方法改动小、能从预训练策略直接微调,对已有 VLA 的团队是个低成本升级路径。
作者承认这不处理外部延迟源(推理服务器和机器人客户端之间的通信延迟),只管推理本身。另外骨架没动,如果一开始就把架构设计得更强调本体感知特征,反应性可能还能再放大。
增益高度集中在需要高频反应的动态任务(倒水、接物)。对静态、准静态操作任务,4 倍提速未必换来同等成功率提升,论文也没给这类任务的数据。25Hz 是 A5000 上的数,边缘部署硬件更弱时延迟自适应能撑到什么程度,没有交代。