线性探针即可引导 VLA,π0.5 抓杯把成功率从 14% 升至 74%

Observing and Controlling Features in Vision-Language-Action Models

Hugo Buurmeijer, Carmen Amo Alonso, Aiden Swann, Marco Pavone

cs.RO

2026-03-06

斯坦福在 OpenVLA、π0、π0-FAST、π0.5 上证明状态与动作可被线性读出,再用最小范数干预把表示推入目标区间。真机抓咖啡杯把从 14% 升到 74%,物体选择 50 次全对,推理开销约 1%。

这篇在解决什么

VLA 把图像、语言和本体感觉塞进同一个模型,直接吐连续动作。它能听懂自然语言指令,也能在新场景里摸出大致对的行为,但动作一旦偏了,现场几乎纠不回来。改提示词经常纹丝不动,微调又贵,还可能把原来会做的任务弄坏。

语言模型这边已经有一套便宜做法:在中间层表示上加一个很小的向量,生成就会往某个属性偏。机器人更需要这种旋钮,因为输出会碰到真杯子、真叉子。可 VLA 是多模态、闭环的,不少还是 Transformer 配 flow matching 的混合结构,LLM 上的 activation steering 不能直接搬过来。斯坦福和 NVIDIA 把可观测、可控写成一套定义,然后在四款前沿 VLA 上验证:线性探针能不能从池化激活里读出状态和动作,沿着探针方向改表示能不能改闭环行为,改完任务还能不能做完。

方法

每一层 Transformer 的 token 先做均值池化,得到一个 d 维向量。再用线性映射 W⊤x + b 去预测事先指定的特征:末端位置、姿态、夹爪开合,或对应的动作指令。连续量用均方误差,夹爪这类二值用交叉熵。探针只看 VLM 前缀,hybrid 模型里的 action expert 碰都不碰。

读出来还不等于能控。控制器要找一个最短的加性扰动 u,让探针读数落到区间 [ξmin, ξmax] 里。观察器是线性的、目标是区间,所以 u 有闭式解:超了就沿 W 往回推,没到就往前推,已经在区间里就不动。这个 u 再广播到该层每一个 token 上。论文证明,这是实现同样池化位移时 Frobenius 范数最小的改法。

推理时只在选定层做一次矩阵乘和一次加法。权重点都不用动。

结果

四个模型都测了:自回归的 OpenVLA、π0-FAST,以及 Transformer–flow-matching 混合的 π0、π0.5。数据覆盖 LIBERO、DROID、BridgeData V2。笛卡尔位置的 R² 在 0.81 到 1.00,姿态在 0.53 到 0.99,动作指令明显更难读。π0.5 在连续特征上平均最强。动作在真机数据上的可解码性比 LIBERO 低大约三分之一,状态几乎不掉。架构之间的差距,没有仿真和真机之间的差距大。

闭环只拿冻结的 π0.5,在 LIBERO 和 DROID 真机上跑,推理在一块 RTX 5090 上。对照包括原策略、改提示、value-vector steering、拒绝采样和动作裁剪。

设置原策略提示词value vector线性干预
酒瓶底部抓取(仿真 100 次)28%40%3%73%
咖啡杯把手(真机 50 次)14%46%38%74%
搅拌器选香蕉不选金属叉(真机 50 次)52%40%64%100%
烤箱选玻璃杯不选塑料碗(真机 50 次)48%62%94%100%

搬运高度约束上,拒绝采样把预算加到 K=100,约束满足率仍低于 10%,中位推理时间涨 583%。value vector 上界大约 74%,下界 0%。线性干预大约 1% 额外开销(50 次前向统计)。动作裁剪对几何约束本身就很好用,下界还要人为加 4 厘米裕量,好让手臂早点开始抬。

为什么重要

这是给已经训好的 VLA 加了一层便宜的运行时旋钮:想换抓法、想避开某类物体,不必再收集演示,也不必再微调。1% 的开销可以挂在同一块 5090 上跟着策略跑。提示词在这几项任务上几乎推不动策略。value vector 在酒瓶任务上把偏好抓取从 28% 打到 3%,比不动还差。沿着能解码该特征的方向、按样本适配步长,比固定加一个向量稳。

它管的是偏好和软约束,不是安全。物体选择 50 次全对,也不构成安全保证,输出侧过滤器该配还是要配。纯几何约束上,动作裁剪可能更直接。

局限与存疑

观察器需要带标签的 rollout,这篇用 50 条原策略轨迹来拟合。大规模机器人数据常常没有这种逐维标注。干预只打在 Transformer 层,flow matching 的 action expert 既没被解释也没被控。表示空间里的一推,对执行轨迹没有形式化界,安全关键场景不能只靠这一层。

抓取偏好也没有做到全对:酒瓶 73%、杯把 74%,剩下的 rollout 仍会抓错位置。仿真高度约束在图上显示满足率上升、任务成功率仍高,正文却没有给出本方法的精确百分比。真机每项只有 50 次,「100% 选对」应读成「这一设置下 50 次全中」,不是保证。

术语

原文与代码

社区讨论

相关论文

全部论文解读