康奈尔 Proxy Policy Steering:不改权重让冻结机器人策略学会新任务
philfung · x · 2026-09-28
康奈尔大学团队(含 Weichiu Ma、Kuan Fang 等)提出 Proxy Policy Steering(PPS),一种推理时方法,可让大型冻结机器人策略从少量演示中适应新任务,且完全不修改其权重。
核心做法是训练两个小网络:一个从冻结的基础策略蒸馏出的 reference proxy,另一个在其上用任务演示微调出的 task proxy。采样时在速度空间加残差来引导基础模型的扩散轨迹:vPPS = vbase + γ(vtask − vref)。
亮点:基础模型参数从不被修改,甚至不需要访问基础模型本身。方法在 8 个真实世界任务(冲咖啡、插花、叠牛仔裤、取鞋、擦桌子等)和 4 个仿真操作任务上验证。
「具身」频道最新
- 55nm 老工艺并行制造微型机器人,蚀刻掉硅基板后即可漂浮 — ctjlewis · 2026-09-28
- Austin 体验 Waymo 无人车:FSD 重度用户也称「大开眼界」 — lydiahallie · 2026-09-28
- 本地小模型采样器 Engram 上线众筹,专做「AI 幻觉音色」 — The Verge AI · 2026-09-28
- Mark Cuban:人形机器人 5-10 年内会失败,专用形态才是出路 — rohanpaul_ai · 2026-09-28
- 给人形机器人做衣服,做成了软外饰子系统 — yongqianme · 2026-09-28
- 苏黎世联邦理工人形机器人与人类对打羽毛球 — DominiqueCAPaul · 2026-09-28