从 RLHF 到机器人 shaping:人类评价如何变成奖励信号

binarybits · x · 2026-10-11

作者与 @andrewprock 讨论 RLHF 与机器人行为塑形(shaping)在奖励机制上的同构性:在 Christiano 等人的 RLHF 工作中,人类判断是从中推断奖励函数的数据,关键问题是——智能体能否从偶尔的偏好比较中学到人类所说的「更好」,再据此自产密集的训练信号。

对照到机器人 shaping,训练者的评价本身就是奖励生成机制的一部分,工程问题变成:该如何奖励、惩罚、分解和结构化训练,让期望行为自然涌现。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →