一张贴纸让 π0 机器人失效率逼近 100%,论文戳破 flow-matching 策略的对抗鲁棒性

DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack

Hoseong Tae, Jong-Seok Lee

cs.CV, cs.LG

2026-08-04

在 π0/π0.5 机械爪上贴一张优化好的贴纸,只攻击去噪第一步,四个 LIBERO 套件的任务失败率逼近 100%,远超动作、嵌入空间攻击。

这篇在解决什么

π0 和 π0.5 这类 vision-language-action(VLA)模型不靠逐 token 生成动作,而是用 flow matching 把一段高斯噪声逐步去噪成连续的动作序列。2026 年一份鲁棒性基准测下来,发现这种 flow-matching VLA 对抗扰动的耐受度远好于 OpenVLA 那类自回归 VLA,结论一度是 flow matching 天生更抗攻击。

延世大学的 Hoseong Tae 和 Jong-Seok Lee 认为这个结论站不住。已有的攻击要么在最终动作空间下手(UADA),要么在视觉编码器的嵌入空间下手(EDPA),都绕开了 flow matching 真正生成动作的那条多步去噪 ODE。不去碰这条轨迹,等于没打在要害上。

方法

DRIFT 的威胁模型非常克制:攻击者在机械爪的腕部相机视野里贴一张 32×32 像素(实物约 2–3 厘米,占腕部画面 2%)的小贴纸,离线优化一次后固定下来,部署时不再碰模型、不做在线反馈。其余观测、本体感受、语言指令全不动。

要害在于它打的是去噪速度场,而不是最终动作或嵌入。π0 用 K=10 步 Euler 积分把噪声推成动作,作者逐个测试每个去噪步 k 的可攻击性,发现漏洞集中在轨迹开头:攻击 k≤5 的任意早期步都能把任务几乎全部打挂,而攻击 k≥6 的后期步成功率掉到接近零。早期步之所以关键,是因为 ODE 求解是自回归的,第 k 步引入的方向误差会被后续每一步积分放大;越早注入,放大链越长。

反直觉的结论在这里。既然早期步都能打,直觉是多打几步应该更稳。实测正好相反。把攻击窗口从第 1 步扩到前 3 步,平均成功率从 99.8% 掉到 77.5%;扩到前 5 步,79.7%。原因是一个输入空间优化特有的梯度冲突:不同去噪步对贴纸的梯度方向并不一致,第 1 步的梯度 g₀ 和最后一步 g₉ 余弦相似度约 −0.35,近乎反向。把这些相互打架的梯度加起来,信号互相抵消,窗口越宽抵消越狠(归一化对齐度从 M=1 的 1.00 一路掉到 M=10 的 0.45)。

于是只打第 1 步既最强又最省:省掉后面 9 步的前向和反向,优化成本降到全程攻击的 1/K。

结果

四个 LIBERO 套件(Spatial/Goal/Object/Long)上,π0 干净状态的任务成功率约 97–98%。贴上随机贴纸几乎不影响(0.7%),现有攻击里最强的 EDPA 在同等 32 像素预算下干脆失效,只能放大到 64 像素才勉强到 25.3% 平均成功率。UADA 平均只有 13.2%。

DRIFT 在 32 像素下四个套件平均攻击成功率 99.8%,动作偏离量(NAD)也最高:

方法(攻击 π0)像素平均成功率平均 NAD
UADA(动作空间)3213.2%4.3%
EDPA(嵌入空间)6425.3%5.4%
DRIFT3299.8%8.5%

π0.5 比 π0 更扛打,需要 64 像素贴纸才破,但 DRIFT 仍拿到 99.3% 平均成功率、20.0% NAD,而 UADA 是 30.5%、EDPA 仅 1.5%。

失败模式很统一,作者叫它「幻影抓取」:贴纸一上,机械爪在前 7 个控制步内(平均 3.8 步)就提前闭合,还没靠近任何物体就攥紧了空,之后手臂继续移动(平均位移 40.6 厘米,离物体最近也只有 18.6 厘米),却永远走不完靠近、抓取的动作序列。

扰动预算 ε 存在陡峭的相变:ε≤0.05 时成功率不足 8.2%,ε=0.1 时跳到 97%,几乎全有或全无。

为什么重要

对在真实场景部署 π0 或 π0.5 的人来说,这条结论很直接:只要对手能拿到部署策略的梯度(白盒),再在腕部相机里贴一张不显眼的贴纸,就能让机器人几乎百分百抓空。那份 2026 年基准报告的「鲁棒」是攻击没打对地方造成的假象,不是 flow matching 本身的功劳。

它也指明了防御方向:去噪轨迹的最早几步是最脆弱的环节,保护住开头比保护全链路更紧要。贴纸还能约束成灰度、融入深色机械爪而不减效(只需约两倍扰动预算),物理隐蔽性不差。

局限与存疑

威胁模型是白盒的,跨模型迁移很弱:在 π0 上优化好的贴纸直接搬到 π0.5 只有 8.9% 成功率(反过来 24.7%)。有效攻击需要拿到具体部署策略的梯度,没法简单跨版本照搬,黑盒场景下威胁有限。

实验只在 LIBERO 仿真里做,没有上真机,真实光照和相机噪声下贴纸是否同样奏效没有验证。「幻影抓取」是无目标的,机器人是被搞瘫,而不是被引向攻击者指定的动作,对想做精准劫持的对手用处有限。作者把「只打第一步」的结论和训练期后门 FlowHijack(需要宽窗口)对比,但那是另一个威胁模型,这个反向对照的说服力取决于读者是否接受两者可比。

术语

原文与代码

相关论文

全部论文解读