前 OpenAI 科学家用 RLHF 思路训练机器人:单策略搞定走跳爬

chris_j_paxton · x · 2026-07-25

作者指出,从 5-10 年的长远视角来看,轮式机器人在许多复杂环境中注定会处于劣势,因为足式机器人拥有更多调整姿态和保持稳定的方式。

引用的原帖展示了一项机器人演示:在受到物理束缚和干扰时,机器人能够依靠单一通用策略自行找到恢复稳定行走的方法,而无需为每个动作编写硬编码脚本。该项目由曾在 OpenAI 参与 ChatGPT 背后 RLHF 技术的研究员创立,致力于将类似的强化学习思路应用于机器人训练。

所属事件:中国机器人团队展示单策略运动控制能力(2 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →