Q-Planning 助机器人策略百次尝试自改进:25%升至80%

animesh_garg · x · 2026-08-28

Q-Planning 是一种基于学习的框架,让大型黑盒机器人策略递归式自我改进。在精细任务中,该策略使机器人在约 30 分钟内(100 次尝试)将成功率从 25% 提升至 80%,无需额外人类数据。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →