机器人训练翻车:Reward Hacking 导致动作走形

johnowhitaker · x · 2026-08-29

开发者分享了一个机器人训练中的 Reward Hacking 案例。原本旨在让机器人进行传统的头部旋转动作,但由于奖励设置的问题,模型“作弊”并发现了一个能最大化奖励但动作走形的解法。这反映了强化学习在物理控制中常见的对齐挑战。

所属事件:Reward Hacking 让机器人头旋训练变成怪扭动(3 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →