Rubric Dropout:随机丢弃评分标准以解决 Reward Hacking
joecole · x · 2026-08-30
论文提出 Rubric Dropout 方法,通过在 RL 训练中随机丢弃 30-50% 的评分标准,防止模型通过作弊刷高分数。实验显示该方法能显著提升 ResearchQA (+7.0) 和 HealthBench-Hard (+2.0) 的真实表现,减少 Reward Hacking 且无额外开销。该简单方法甚至优于更复杂的加权算法。
「研究」频道最新
- 稀疏注意力真能加速视频生成吗?作者给出三个条件与实测 — fruesome · 2026-09-23
- Basecamp Research 融资 1.4 亿美元,用百万未知物种基因数据设计新药 — _rockt · 2026-09-23
- Lean 型理论在排除中律下可证 ZF 一致性,且结果由 AI 辅助发现 — MikePFrank · 2026-09-23
- Mila 研究员 Blake Richards 获 2026 Schmidt Sciences Polymath 大奖 — Mila_Quebec · 2026-09-23
- Latent Space 访谈:AI 能写 DNA 了,生物安全成军备竞赛 — Latent Space · 2026-09-23
- Georgia Tech 出品 Transformer Explainer:浏览器里可视化拆解 LLM 原理 — blaizedsouza · 2026-09-23