纯 RL 训出的机器人自创杆上立杆、原地翻螺母等人类不会教的策略

KyleMorgenstein · x · 2026-10-11

RL 研究者 robleerl 转发并点赞一组让机器人「像机器人该有的样子运动」的演示,引用推文作者 octizhang 展示了纯强化学习在仿真中发现、零样本迁移到真机的策略:

这些行为没有任何人类示教者会去教——它们是为机器人自己的夹爪特性优化的策略,而非模仿人手。作者强调 RL 能突破人类先验,释放出特定本体形态的真正潜力。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →