零新增参数给π0.5加流式时序,实机套杯成功率从60%到92%

StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo, Junyi Li, Ruihua Han, Zhi Hou, Hengshuang Zhao

cs.CV

2026-08-27

把每帧图像与指令绑成原子时序单元,KV缓存流式推理加随机间隔训练,π0.5零增参,套杯从60%做到92%、壳牌戏法到80%。

这篇在解决什么

π0 和 π0.5 这类强 VLA 仍然是单帧:当前图进、动作出,历史不进模型。单帧做不了两件事。一是记忆,杯子被盖住再洗牌,当前画面看不出目标在哪。二是空间精度,插笔进细瓶口、纸杯套进杯套,缺多帧视差和结构一致性。

窗口式多帧能补上下文,但序列随时间线性涨,实时控不住;再加一个视频编码器,又和已经训好的 VLA 特征对不齐。港大与 ACE Robotics 的 StreamPI 要在 π0.5 上加时序,而且一个新参数都不加。

方法

核心是 instruction-anchored temporal modeling。每个时刻把多视角图像和语言指令绑成一个原子单元。单元内部双向注意力,图和指令充分交互;单元之间因果注意力,只看过去。指令因此每帧都会再出现一次,不会被越堆越长的视觉 token 冲掉。

推理走 KV cache:历史帧的 Key/Value 缓存起来,新帧只算自己,再去 attend 缓存。上下文长度靠 LLM 的 length extrapolation 消化,注意力结构全靠改 mask,不改权重。训练时 T 取 3 或 5 帧。

第二件是 random-interval streaming training。真实机器人观测是异步的,训练如果永远隔固定帧采样,上机就脆。训练时在基准间隔上加随机扰动,δ 从 [3, 7] 均匀抽;再随机遮掉最早的若干帧,模拟缓存还没填满。适当拉大间隔,例如每 3 帧推理一次,也能给动作执行留出时间。

结果

真机四项,AgileX PiperX 双臂、三相机,每项 100 条遥操作演示。

任务π0.5StreamPI差值
壳牌戏法(15 局)46.7%80.0%+33.3
抓滚动瓶子(30 局)26.7%63.3%+36.6
细瓶口插笔(30 局)40.0%66.7%+26.7
纸杯套杯套(25 局)60.0%92.0%+32.0

仿真 LIBERO 已经很满。π0.5 平均 96.9,StreamPI 在 T=5 到 98.3。LIBERO-Long 92.4 到 95.0,LIBERO-Goal 96.8 到 99.6,LIBERO-Spatial 持平 98.8。CALVIN 五步序列平均长度 4.547,对照 π0.5 的 4.313 和 MemoryVLA 的 4.090;第 5 步成功率 85.0% 对 79.5% 对 69.4%。

消融:单元内改成因果注意力,T=5 时 LIBERO-Long 掉 5.6 个点。随机间隔相对固定 δ=1,T=5 平均从 97.0 到 98.3。T=5 训完的模型测 T=3 几乎不掉,测 T=1 仍高于单帧 π0.5。

RTX 4090 上单帧 94.4 ms,T=5 为 103.6 ms,多 9.2 ms。

为什么重要

给已经很强的单帧 VLA 加记忆,不一定要新模块。改注意力掩码、把指令每帧钉回去、训练时把帧间隔打散,这三件事覆盖了记忆任务和精细插入任务。延迟几乎按常数走,比窗口拼接更适合上机。

适用场景很具体:需要跨帧记忆,或者单帧几何不够用的操作。LIBERO-Spatial 没有提升,静态空间关系单帧已经够,硬加时序可能只是塞进无关运动线索。

局限与存疑

论文没有独立的局限节。真机样本小:壳牌 15 次、滚动瓶 30 次、插笔分三个模式各 10 次,没有报置信区间。真机对照几乎只有 π0.5,没有和窗口式多帧 VLA 在同一硬件上比成功率和延迟。KV cache 超过 T 会整段清空,不是无限记忆。LIBERO 接近饱和,平均 1.4 的提升更多是方法成立的旁证。随机间隔的仿真收益清楚,论文没有单独把「上机异步」做成对照实验,鲁棒性主张主要靠设计叙述。

术语

原文与代码

相关论文

全部论文解读