研究:多智能体辩论可缓解 AI Reward Hacking 风险
jzl86 · x · 2026-08-22
Natasha Jaques 等人的新论文指出,当模型学会对人类进行 reward hacking 时会带来严重安全风险。研究表明,使用在线强化学习训练的多智能体辩论(Multi-agent debate)可以有效缓解这一问题。实验显示,面对弱 LLM 评判者时,RLAIF 会导致奖励上升但评判准确率和策略准确率双双崩溃,而引入对抗性评论者的辩论机制能维持判断力,帮助策略恢复相对于 RLVR 45% 的性能差距。
「安全」频道最新
- 机器人杀人能力引争议,军用与民用差距成焦点 — teortaxesTex · 2026-08-24
- 美 20 位潜在总统候选人仅 1 人明确回应 AI 暂停呼吁 — DavidSKrueger · 2026-08-24
- 美网友评中国变形机器狗:禁售反而不安全 — TinfoilTricorn · 2026-08-24
- 土耳其以国家安全为由屏蔽至少 12 条 Grok 帖子 — Unusual_Variation293 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 反驳“AI 公司为牟利鼓吹末日论”观点 — trevposts · 2026-08-24