自由形式偏好:多维度机器人监督方法

chelseabfinn · x · 2026-07-03

作者介绍「自由形式偏好」(freeform preferences)方法:让监督者先定义相关评估维度,再沿这些维度给出偏好。维度既可以是固定评分标准,也可以是自然语言描述。这种方式消除了歧义,能全面覆盖各维度,并提供更密集的监督信号(配方法示意图)。该推文为其奖励模型研究线程的核心方法说明。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →