前 OpenAI 科学家用 RLHF 思路训练机器人:单策略搞定走跳爬
chris_j_paxton · x · 2026-07-25
作者指出,从 5-10 年的长远视角来看,轮式机器人在许多复杂环境中注定会处于劣势,因为足式机器人拥有更多调整姿态和保持稳定的方式。
引用的原帖展示了一项机器人演示:在受到物理束缚和干扰时,机器人能够依靠单一通用策略自行找到恢复稳定行走的方法,而无需为每个动作编写硬编码脚本。该项目由曾在 OpenAI 参与 ChatGPT 背后 RLHF 技术的研究员创立,致力于将类似的强化学习思路应用于机器人训练。
「具身」频道最新
- 外滩大会观察:AI 与硬件厂商分工成型,蚂蚁扮演攒局者 — 智东西 · 2026-09-11
- 亚马逊谷歌卖出6亿台音箱,AGI 时代为何无人再造智能音箱 — julianlehr · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 波兰开发者做 iPhone 应用 可探测附近的 Meta 智能眼镜 — Low-Honeydew6483 · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11