多维度监督带来组合泛化能力

chelseabfinn · x · 2026-07-03

通过多维度监督,机器人可以学到数据中未出现的行为——例如某任务在数据里只有慢速片段,模型却能学会快速完成。这种组合泛化是传统奖励模型无法实现的。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →