用 judge 模型跑 GRPO 偏好长回答,或可解释 LLM 爱写长篇的通病

djcows · x · 2026-09-29

djcows 指出:用 judge 模型打分做 GRPO 训练已被证明会引入对更长回答的偏好——他猜测这或许正是如今一些 LLM 面对简单提示也回长篇大论的原因。一个连接 RLHF 偏差研究与模型行为观察的简短观点。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →