RLHF 核心思想真是 OpenAI 发明?X 上掀起溯源之争
binarybits · x · 2026-10-11
binarybits 与 andrewprock 就 RLHF 的历史地位展开争论。binarybits 认为 RLHF 的关键洞见是「用人类的成对偏好反馈训练一个奖励模型,再用该奖励模型对另一个模型做 RL」,并追问 2017 年之前是否有论文使用过这一技术。andrewprock 则反驳称,使用人类反馈在机器学习领域由来已久、并非 OpenAI 首创,把 RLHF 比作发明灯泡的说法「轻率且纯属胡扯」,并指出相关 Robot Shaping 早期论文作为佐证。争论核心在于:新意究竟在「人类反馈」这一泛化概念,还是在「成对偏好→奖励模型→RL」这一具体 pipeline。
所属事件:RLHF 起源之争:OpenAI 还是 1993 年机器人论文(2 条相关)→
「研究」频道最新
- 谷歌等推出 SepGen:一个模型同时生成视频与分轨音源 — YonatanBitton · 2026-10-11
- OpenAI 黎曼猜想证明为何必须覆盖整族 L 函数,1921 年 Hardy 预言应验 — burny_tech · 2026-10-11
- Schmidhuber 指路:《现代 AI 与深度学习注释史》第 20 节回应质疑 — SchmidhuberAI · 2026-10-11
- Stephen Wolfram《A New Kind of Science》全文可在线免费阅读 — burny_tech · 2026-10-11
- Nature 子刊:人工网络自发涌现任务模块化结构,与大脑架构吻合 — lulzxdxdxd · 2026-10-11
- AI 正在催生「自动化认知科学」:从实验设计到理论建模全流程加速 — burny_tech · 2026-10-11