纯 RL 训出的机器人自创杆上立杆、原地翻螺母等人类不会教的策略
KyleMorgenstein · x · 2026-10-11
RL 研究者 robleerl 转发并点赞一组让机器人「像机器人该有的样子运动」的演示,引用推文作者 octizhang 展示了纯强化学习在仿真中发现、零样本迁移到真机的策略:
- 将杆子立起:机器人不是用手抓取,而是把杆靠在板子腿上推立
- 将齿轮立起:利用轴作为支点推靠
- 处理螺母:直接原地翻转螺母,而不是重新抓取
这些行为没有任何人类示教者会去教——它们是为机器人自己的夹爪特性优化的策略,而非模仿人手。作者强调 RL 能突破人类先验,释放出特定本体形态的真正潜力。
「具身」频道最新
- 美军野外评估人形机器人,IHMC 的 Alex 中选执行高危任务 — CyberRobooo · 2026-10-11
- 用 Codex+Lens Studio 15 分钟把 App 搬上 AI 眼镜 — Scobleizer · 2026-10-11
- Rabbit r1 类设备 dot 内置 Blender 和 Godot 引发惊喜 — kieranklaassen · 2026-10-11
- Matic 创始人:全 AI 人形机器人量产还得等多年,清洁机器人已热销 — Scobleizer · 2026-10-11
- 新款假 RTX 4090 上市,GPU 与显存几乎以假乱真 — chemist_slime · 2026-10-11
- LIBERO-MAX 评测:环境中途一变,所有机器人策略成功率掉 11-26 个百分点 — 机器之心 · 2026-10-11