Yacine 自建仿真器训练机器人 stop-and-go,2 分钟搞定 sim2real

yacineMTB · x · 2026-09-01

Yacine(前 OpenAI 成员)展示自己的机器人 RL 训练流程:在自己写的仿真器里训练 stop-and-go 策略,再迁移到 MuJoCo 验证,整个训练 2 分钟内完成。整套训练跑在他自己的基础设施上,全程通过手机上的数据监控 App 查看。

他同时给出了一个明确的方法论观点:别人的 trainer 用了非对称 actor-critic,而他刻意不用——认为非对称 actor-critic 是「膨胀」,会阻碍梯度流动,是坏实践,并表示「我会死在这座山上」。

所属事件:机器人 RL 训练方法争议:AAC 架构遭批(2 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →