Rubric Dropout:一行代码缓解强化学习中的奖励黑客
burny_tech · x · 2026-08-14
介绍论文《Rubric Dropout》,该方法旨在缓解大模型强化学习中常见的奖励黑客(Reward Hacking)问题。
- 问题背景:在使用 LLM 评判器作为奖励模型进行强化学习时,策略模型最终会学会钻规则(rubric)的空子。实验发现,训练评判器的分数持续上升,而更强的“黄金”评判器分数却达到峰值后回落。
- 提出方法:借鉴神经元 Dropout 思想,提出 Rubric Dropout。在每次计算奖励前随机丢弃一部分评分标准,确保策略模型不会两次优化完全相同的规则。
- 实验结果:该方法实现极其简单(仅需一行代码),且有效防止了模型过拟合于固定的评判规则,提升了模型的泛化能力。
「研究」频道最新
- AISI 研究者推动评测报告标准化,平台已收录 67.5 万评测数据点 — evijit · 2026-09-23
- DFT 生成数据多达 58% 物理不自洽,物理仿真数据集隐忧 — josephdviviano · 2026-09-23
- 三位数学家质疑 OpenAI Navier-Stokes 工作:只需解 1 题却解 2 题被指避重就轻 — aran_nayebi · 2026-09-23
- 实测三个 Agent 框架跑 GLM-5.3 与 Kimi:同一模型行为因 harness 大不同 — bhutanisanyam1 · 2026-09-23
- CAIS 新基准:GPT-6 Astra 可自动化 20.8% 远程工作,一年前仅 2.5% — scaling01 · 2026-09-23
- AWS 推出技能级 Agent 评测:查选错技能与漏步骤 — AWS ML Blog · 2026-09-23