清华 RoboCoach 用世界模型当教练,150 次演示把成功率从 13.3% 拉到 75%
Tsinghua · hf · 2026-10-01
长程机器人操作需跨任务复用技能,而靠追加端到端演示改进组合代价高昂。清华的 RoboCoach 用共享的动作条件世界模型 CoachWorld 充当主动教练:RIDI(路由-想象-诊断-改进)循环在其中运行可复用技能专家,用进度判官记录首个失败子任务,聚合记录决定采集哪些子任务演示、更新哪些专家适配器。
实验横跨两套仿真与两个真机平台,想象成功与实际部署成功在 22 个任务-策略对上相关性 rho=0.840。仅追加 150 个子任务演示,Franka 上成功率从 13.3% 升至 75.0%,AgileX 从 40.0% 升至 83.8%;训练出的专家还能迁移到四个未见组合,平均成功率 35.0%,而均匀采集演示的共享策略基线为 0%。
「具身」频道最新
- 西方机器人公司忽视「便宜」,人形机器人竞争本质是成本战 — hudzah · 2026-10-01
- 博主预言人形机器人将进驻酒店洗衣等场景 — CyberRobooo · 2026-10-01
- NVIDIA 发布 Instant NuRec:1.5 秒前馈重建驾驶场景 3DGS 世界 — rsasaki0109 · 2026-10-01
- 清华博士创业做餐饮后厨机器人,已完成千万级种子轮 — 创业邦 · 2026-10-01
- GPT-6 Astra 机器人实测:任务决策强,物理控制仍是短板 — Galbot · 2026-10-01
- GGSD:用游戏自博弈发现人类可直接操控的具身技能,零训练解新任务 — Seungeun Rho · 2026-10-01