新法 Q-Planning 让机器人半小时自我精进,成功率从 25% 升至 80%
animesh_garg · x · 2026-08-31
机器人传统模仿学习在精细任务上难以自我改进。新提出的 Q-Planning 方法引入一个小型的“评论家”模块,对机器人可能的下一步动作进行打分。
核心原理:
- 保持原有的行为克隆(BC)策略冻结不变。
- 仅更新 Q-function,使其能从成功和失败的尝试中学习。
- 推理时,通过 Q 加权平均选择更优动作。
实测效果:
- 在双臂机器人真实测试中,钱包插入任务成功率从 25% 提升至 80%。
- 叠杯子任务亦有显著提升。
- 仅需约半小时的自主尝试即可实现性能飞跃,无需额外人类示教。
论文链接:Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning
「具身」频道最新
- 2026 上半年中国人形机器人出货量占全球 86% — rohanpaul_ai · 2026-08-31
- 机器人学专家讨论仿生结构差异与局限 — dhadfieldmenell · 2026-08-31
- 特斯拉 Cybercab 本周发布,如何做好准备 — JOBhakdi · 2026-08-31
- 中国公司推出 AI 自动化烹饪机器人 — yogthos · 2026-08-31
- S1 模型长程任务优势指数级增长,ICL 破局未见场景 — ZeYanjie · 2026-08-31
- 单 4090 2 分钟训练,Sim2Sim 迁移展示机器人控制 — yacineMTB · 2026-08-31