Spline Policy: A Structured Representation for Robot Policies
Mengze Tian, Yiming Li, Sichao Liu, Auke Ijspeert, Sylvain Calinon
cs.RO
2026-06-05
EPFL/Idiap 的 Spline Policy 只把策略输出从动作块改成样条参数:骨干不动,六项任务分持平,网络前向 FLOPs 平均省约三成,扰动恢复与观测噪声下明显更鲁棒。
现在模仿学习做机器人操作,主流策略都把动作表示成「action chunk」:一段固定长度的离散路点序列。ACT、Diffusion Policy、Flow Matching Policy,以及 π0 这类 vision-language-action(VLA)模型,无一例外。它简单好用,但有个结构上的硬伤:执行之前你看不到这条轨迹长什么样。点与点之间没有显式的连续性、没有导数、没有边界条件,没法换一种时间分辨率重新采样,也谈不上把不确定性传播过去或者接到经典控制器里。
另一头,learning-from-demonstration 领域早有 DMP、ProMP 这类运动基元(movement primitive),天生带几何和时间结构,好编辑、好约束、好接控制,但它们和高维感知、多模态的现代策略对不上。EPFL 的 Ijspeert 和 Idiap 的 Calinon 两位长期做运动基元,这篇就是想把两头长处拼起来:骨干网络不动,只换输出表示。
核心动作一句话:策略骨干(diffusion / flow-matching / transformer / VLA 任选)照旧从观测预测动作,只是把原来吐出的「一串路点」换成「一组样条参数」w。用样条基函数解码,得到一条连续轨迹 f(t)=φ(t)·w,想在任意时间分辨率上采样都行。
这条样条能干几件 action chunk 干不了的事:
第二种用法更值得讲。当样条取二次 Bernstein 形式时,作者用一套解析的距离场构造把这条样条变成依赖状态的流场(flow field):对机器人当前状态 x,先投影到样条上找最近点,再叠加一个指向样条的吸引力项和沿样条切向的推进项。在正则性假设下,这套诱导动力学不会增加状态到样条的距离,机器人被推开后会被拉回预定轨迹,给出一个原则性的局部纠偏机制。这个流场还能通过零空间投影和经典避障控制器拼在一起,不用重训骨干。
作者在 LASA 数据集上测扰动恢复(25 次扰动 × 3 种演示),看三个指标:Chamfer 距离、收敛误差、最大速度。
| 方法 | Chamfer (mm) | 收敛误差 (mm) | 最大速度 (m/s) |
| 基线 Diffusion Policy | 26.2 | 26.7 | 13.0 |
| SP(轨迹) | 21.0 | 28.8 | 14.3 |
| SP(流场) | 12.8 | 1.1 | 0.25 |
流场版把收敛误差从 26.7 mm 直接压到 1.1 mm,这是这套表示最亮眼的数字。
观测噪声下(给输入加高斯噪声),概率版 SP 把 Chamfer 距离压得很低:噪声标准差 10 mm 时基线是 8.6,SP 概率轨迹版只有 0.7;到 40 mm 噪声时,基线 20.4,概率版 6.1。
行为克隆基准是六项任务(状态、视觉、点云三种输入各两项),骨干严格对齐。这里要诚实说:SP 在任务分上并不更好,有的持平、有的略好、有的略差(Tool Hang 上 SP-Diff 的 0.80/0.76 低于基线 0.88/0.80,Can 上大家都 1.0)。作者自己讲清楚,这个基准只证明「换输出表示后性能仍在同一档」,不宣称性能更优。真正一致的变化是算力:因为输出维度从一整段路点缩成每段动作 8 个样条参数,网络前向 FLOPs 按任务降到原来的 50.67%–87.63%(状态与点云任务降幅最大),六项平均省掉约三成。
真机上用 Franka 做了四个案例:120 段人类演示训出的酒杯递送、推拉扰动下的回正、零空间避障,以及装液体的杯子轻晃;还在 ALOHA 上用 ACT、Diffusion Policy、π0.5 三种骨干跑了 PushT 和玩具装箱,姿态随机化。
这篇的价值不在「让机器人更聪明」,任务分已经说明它没有。价值在于给现代策略补上一层可操作的运动结构:更省算力,外加能换采样率、能量化不确定性、能在执行时局部自纠偏、能接经典控制。对一个要把策略稳稳部署到真机上的工程师,这些都是 action chunk 给不了、又确实需要的接口能力。
作者交代得很清楚。其一,它不替代一个准确的骨干:策略本身预测出糟糕的样条时,结构化解码器和流场都没法保证任务成功。其二,「拉回样条」的纠偏性是局部的,只在生成运动附近、构造假设成立时有效,不是任务级的稳定性或成功保证,也管不住训练分布外的离群状态。其三,对高度不连续或强动态的交互(比如击打移动物体)不太合适。其四,解析流场这一路依赖二次样条加 C⁰/C¹ 连续性,推广到更广的样条族是未来工作。
另有需要留意的一点:六项任务里 SP 真正显著占优的场景很少,主要收益集中在 LASA 这种低维扰动与噪声实验,以及 FLOPs 的下降。把它当「表示层改造」而不是「新 SOTA」看,结论才站得住。