从 RLHF 到机器人 shaping:人类评价如何变成奖励信号
binarybits · x · 2026-10-11
作者与 @andrewprock 讨论 RLHF 与机器人行为塑形(shaping)在奖励机制上的同构性:在 Christiano 等人的 RLHF 工作中,人类判断是从中推断奖励函数的数据,关键问题是——智能体能否从偶尔的偏好比较中学到人类所说的「更好」,再据此自产密集的训练信号。
对照到机器人 shaping,训练者的评价本身就是奖励生成机制的一部分,工程问题变成:该如何奖励、惩罚、分解和结构化训练,让期望行为自然涌现。
「漫话AGI」频道最新
- AI 已能解题,下一步该优化的是「构建数学理论」 — burny_tech · 2026-10-11
- Beff Jezos 谈后劳动经济:解法始终是资本主义与企业家思维 — beffjezos · 2026-10-11
- AI 让数学研究快了,数学家为何反而不高兴? — burny_tech · 2026-10-11
- 陶哲轩观点引争议:连泰诺药理都没搞懂,多数药物其实「未对齐」 — AntonObukhov1 · 2026-10-11
- AI 自主性上升,TansuYegen 称自愿安全承诺恐不足 — TansuYegen · 2026-10-11
- Alan Turing Institute 警告:完全依赖外国 AI 模型成战略脆弱性 — TansuYegen · 2026-10-11