DeepMind 研究称辩论训练可缓解 RLAIF 奖励黑客

Google DeepMind 发表新论文,提出在 RLAIF 中引入辩论训练(Debate Training),可有效减少奖励黑客现象。研究发现,当使用较弱的 LLM 判别器时,RLAIF 会出现奖励持续上升但判别器和策略准确性反而崩溃的奖励黑客问题;而加入对抗性评论员构成的 AI 辩论机制后,可维持判别质量,恢复约 45% 的性能损失。

2026-08-19 ~ 2026-08-19 · 2 条相关