别把 2024 年论文当突破:RLAIF 早已被广泛使用
burny_tech · x · 2026-09-20
有人转推 Meta 2024 年论文《Self-Rewarding Language Models》(ICML 2024)并称之为迈向递归自我改进的重大突破,burnytech 纠正说这是老闻:AI 反馈强化学习(RLAIF)早已被业界长期使用。
该论文的核心做法是用 LLM-as-a-Judge 让模型在训练中给自己提供奖励信号,配合迭代 DPO:Llama 2 70B 经三轮迭代后在 AlpacaEval 2.0 上超过 Claude 2、Gemini Pro 和 GPT-4 0613,且指令跟随与奖励质量双提升。
「Fun」频道最新
- Protocol Labs 创始人:Factorio 玩家才是最佳雇员 — juanbenet · 2026-09-20
- Juan Benet 提议用公制前缀给智能分级:人类 1 Brain,人类全加起来约 8 GigaBrain — juanbenet · 2026-09-20
- Anthropic 咖啡馆被指停业,官方辟谣:仅临时许可过期 — zealcaiden · 2026-09-20
- AI 只改 ISO 几个字节,绕过内存检测跑通 Windows XP 游戏 — gabriel1 · 2026-09-20
- Holdout Juror Simulator 预告:11 名陪审员对峙 7 天,你能扛住吗 — justin_hart · 2026-09-20
- Waymo 车里出现神秘纸条,车主发现车牌被人偷装 — chrisalbon · 2026-09-20