康奈尔 Proxy Policy Steering:不改权重让冻结机器人策略学会新任务

philfung · x · 2026-09-28

康奈尔大学团队(含 Weichiu Ma、Kuan Fang 等)提出 Proxy Policy Steering(PPS),一种推理时方法,可让大型冻结机器人策略从少量演示中适应新任务,且完全不修改其权重。

核心做法是训练两个小网络:一个从冻结的基础策略蒸馏出的 reference proxy,另一个在其上用任务演示微调出的 task proxy。采样时在速度空间加残差来引导基础模型的扩散轨迹:vPPS = vbase + γ(vtask − vref)。

亮点:基础模型参数从不被修改,甚至不需要访问基础模型本身。方法在 8 个真实世界任务(冲咖啡、插花、叠牛仔裤、取鞋、擦桌子等)和 4 个仿真操作任务上验证。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →