Engineer explains RLHF: humans rating model outputs is standard practice at every lab

JFPuget · x · 2026-09-16

Amid controversy over reports that OpenAI used contractors to review chat logs, IBM's JFPuget clarified: RLHF means Reinforcement Learning from Human Feedback — these reviewers evaluate generated text, and the model is then trained to favor highly rated outputs. This has been standard practice at essentially every lab for years.

Original post →

More from Models

Models channel →