递归经验蒸馏让机器人操作成功率从 37.3% 提升至 64.0%
SeoulNatlUniv · hf · 2026-09-29
首尔国立大学提出 Recursive Harness Distillation:强 agent 将干预经验蒸馏成 playbook,再根据轻量 agent 的执行反馈递归精炼,使新任务可复用积累的知识而无需更新模型参数。
- 真实世界操作:成功率从 37.3% 提升至 64.0%
- SimplerEnv Bridge:轻量 agent 携带 playbook 达 66.7%,远超仅用 GR00T 的 41.7%,甚至超过无 playbook 的强 agent;强 agent 也能从 playbook 受益至 79.2%
- 结论:干预经验可被积累、经执行精炼并在 agent 间复用
「具身」频道最新
- Wayve 自动驾驶随 Uber 亮灯登陆伦敦街头 — alexgkendall · 2026-09-29
- 特斯拉 FSD Supervised 获克罗地亚批准,成欧洲第 8 个市场 — mitchdeg · 2026-09-29
- 微调 π0.5 教训:演示中的闲置时间会被机器人学走 — lhoestq · 2026-09-29
- Microagi 隐秘收购挖走 Georgia Tech 教授 Garg 及 7 人团队 — lukas_m_ziegler · 2026-09-29
- 清华团队人形机器人羽毛球上线:30 分钟动数据学会正反手与跳杀回球 — ChongZzZhang · 2026-09-29
- Bose 回归有线降噪耳机:99 美元靠 USB-C 供电,告别电池砖 — aakashgupta · 2026-09-29