RLHF 起源之争:OpenAI 还是 1993 年机器人论文
X 平台上 binarybits 与 andrewprock 就 RLHF 的历史地位展开溯源争论。一方认为 RLHF 的核心思想——用人类成对偏好反馈训练奖励模型——常被归功于 OpenAI;另一方则引用 1993 年论文《Robot Shaping》指出该思路早在当年已有雏形,质疑 RLHF 并非 2017 年才被发明的说法,引发社区对 AI 技术起源归属的讨论。
2026-10-11 ~ 2026-10-11 · 2 条相关
- RLHF 并非 2017 年发明?1993 年机器人塑形论文已有雏形 — andrewprock · 2026-10-11
- RLHF 核心思想真是 OpenAI 发明?X 上掀起溯源之争 — binarybits · 2026-10-11