Jason Weston:LLM 评委偏爱机器味文本,需学习人类偏好 rubric

ivan_bezdomny · x · 2026-09-28

Meta 的 Jason Weston 发推讨论标准 LLM-as-judge 的失败:在论文写作任务上,GPT-5.6 或 Opus-4.8 这样的强评委用两两对比或常规 rubric 打分时,会认为当前的「slop」模型胜过精选的人类高质量论文。其方法的核心是让评委学习新的 rubric,使得评分时人类被认为更好——这是后续训练的关键。引用者 ivanbezdomny 补充共鸣:LLM 评委常偏好人类并不太在意的奖励信号,模型随即开始 hack 这些奖励;这在「事实密度」等启发式指标上同样成立,他自己训练新闻写作时也遇到。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →