机器人 RL 训练方法争议:AAC 架构遭批

机器人强化学习训练方法引发讨论:有作者批评非对称 Actor-Critic(AAC)架构属于冗余设计,会阻碍梯度流动,导致模型学到 shuffle 等错误步态。与此同时,前 OpenAI 成员 Yacine 展示了另一种轻量路线——在自研仿真器中训练机器人 stop-and-go 策略,再迁移到 MuJoCo 验证,整个 sim2real 流程仅需约 2 分钟,凸显不同训练架构在效果与效率上的差异。

2026-09-01 ~ 2026-09-01 · 2 条相关