教奖励模型自我纠错(ACL口头)

furongh · x · 2026-07-07

furongh分享ACL 2026口头论文,提出让奖励模型自我纠错的方法,通过奖励引导的对抗性失败发现来构建更鲁棒的奖励模型,涉及奖励黑客与对齐/安全方向。

所属事件:ACL 2026论文提出奖励模型自我纠错新方法(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →