RLHF 核心思想真是 OpenAI 发明?X 上掀起溯源之争

binarybits · x · 2026-10-11

binarybits 与 andrewprock 就 RLHF 的历史地位展开争论。binarybits 认为 RLHF 的关键洞见是「用人类的成对偏好反馈训练一个奖励模型,再用该奖励模型对另一个模型做 RL」,并追问 2017 年之前是否有论文使用过这一技术。andrewprock 则反驳称,使用人类反馈在机器学习领域由来已久、并非 OpenAI 首创,把 RLHF 比作发明灯泡的说法「轻率且纯属胡扯」,并指出相关 Robot Shaping 早期论文作为佐证。争论核心在于:新意究竟在「人类反馈」这一泛化概念,还是在「成对偏好→奖励模型→RL」这一具体 pipeline。

所属事件:RLHF 起源之争:OpenAI 还是 1993 年机器人论文(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →