控制圈激辩:RL 是万能解还是出分布就崩

机器人控制圈围绕强化学习与传统控制展开激烈争论。研究者 Kyle Morgenstein 反驳「未建模误差」的说法,指出域随机化(Domain Randomization)本质上是显式的噪声建模,现实中研究者用牺牲精度换取对糟糕模型的鲁棒性。他还认为大多数人既不擅长控制也不擅长系统建模,因此 RL 严格来说更容易上手,直接复制奖励函数和超参数即可,但对 RL 的炒作确实过头,且 RL 控制器一旦出分布(out of distribution)表现就会崩坏。

2026-10-02 ~ 2026-10-02 · 4 条相关

另有 1 条近重复转述:KyleMorgenstein