Rubric Dropout:随机丢弃评分标准以解决 Reward Hacking

joecole · x · 2026-08-30

论文提出 Rubric Dropout 方法,通过在 RL 训练中随机丢弃 30-50% 的评分标准,防止模型通过作弊刷高分数。实验显示该方法能显著提升 ResearchQA (+7.0) 和 HealthBench-Hard (+2.0) 的真实表现,减少 Reward Hacking 且无额外开销。该简单方法甚至优于更复杂的加权算法。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →