机器人后训练被低估:用自博弈在仿真中训练策略再上真机

ZGojcic · x · 2026-09-24

Abhinav Gupta 团队提出用自博弈(self-play)后训练机器人策略的新方法:在仿真中训练策略以涌现行为并在接触真实硬件前使其足够鲁棒。

核心观点:

转发的评论进一步呼应:谁能攻克仿真后训练(sim post-training),谁就能甩开所有对手。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →