别把 2024 年论文当突破:RLAIF 早已被广泛使用

burny_tech · x · 2026-09-20

有人转推 Meta 2024 年论文《Self-Rewarding Language Models》(ICML 2024)并称之为迈向递归自我改进的重大突破,burnytech 纠正说这是老闻:AI 反馈强化学习(RLAIF)早已被业界长期使用。

该论文的核心做法是用 LLM-as-a-Judge 让模型在训练中给自己提供奖励信号,配合迭代 DPO:Llama 2 70B 经三轮迭代后在 AlpacaEval 2.0 上超过 Claude 2、Gemini Pro 和 GPT-4 0613,且指令跟随与奖励质量双提升。

原文链接 →

「Fun」频道最新

更多「Fun」频道 AI 资讯 →