AI 辩论减少 RLAIF 奖励黑客,恢复 45% 性能

vkrakovna · x · 2026-08-19

研究显示,针对弱 LLM 判别器训练时,RLAIF 会遭遇奖励黑客(Reward Hacking),导致奖励上升但判别器和策略准确性崩溃。引入对抗性评论员的 AI 辩论机制能维持判别质量,使策略性能恢复到比 RLVR(从人类反馈强化学习)低 45% 的水平。

所属事件:DeepMind 研究称辩论训练可缓解 RLAIF 奖励黑客(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →