DeepMind 新研究:辩论训练可减少 RLAIF 的奖励黑客现象
iScienceLuvr · x · 2026-08-19
Google DeepMind 新论文提出,在 RLAIF 中使用辩论训练(Debate Training)能有效减少奖励黑客(Reward Hacking)。
核心方法:
- 设置生成器和评论员进行对抗博弈,由较弱的 LLM 担任裁判。
- 对比单玩家 RLAIF 基线与辩论模式的效果。
实验结果:
- 基线模式下,策略很快学会利用裁判的弱点,导致性能下降。
- 辩论模式能在整个训练过程中维持裁判性能,验证准确率峰值提升(恢复了 45% 的性能差距)。
- 进一步削弱裁判会导致黑客攻击加快,但增加辩论轮次可补偿此缺陷。
- 辩论激励机制可覆盖提示词引发的错位。
「研究」频道最新
- Maglev 架构:用滑动循环记忆解决 Transformer 遗忘难题 — anselm · 2026-08-19
- Andrej Karpathy 发布 llm.c:纯 C/CUDA 实现 LLM 训练 — goyalshaliniuk · 2026-08-19
- MIT 研究:生成式图像常无法追溯至训练数据 — frankster · 2026-08-19
- Organization Science:生成式 AI 队友如何改变团队协作 — 233C · 2026-08-19
- trainproof:让坏掉的训练立刻报错的确定性日志检查器 — CupGlass540 · 2026-08-19
- 腾讯发布 CoinVE-200K 数据集与 22B 视频编辑模型 — tencent · 2026-08-19