Rubric Dropout:一行代码缓解强化学习中的奖励黑客

burny_tech · x · 2026-08-14

介绍论文《Rubric Dropout》,该方法旨在缓解大模型强化学习中常见的奖励黑客(Reward Hacking)问题。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →