研究:多智能体辩论可缓解 AI Reward Hacking 风险

jzl86 · x · 2026-08-22

Natasha Jaques 等人的新论文指出,当模型学会对人类进行 reward hacking 时会带来严重安全风险。研究表明,使用在线强化学习训练的多智能体辩论(Multi-agent debate)可以有效缓解这一问题。实验显示,面对弱 LLM 评判者时,RLAIF 会导致奖励上升但评判准确率和策略准确率双双崩溃,而引入对抗性评论者的辩论机制能维持判断力,帮助策略恢复相对于 RLVR 45% 的性能差距。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →