LMArena 后训练配方:偏好+细则奖励组合,Flux2dev Elo 提升 69 分

lmarena-ai · hf · 2026-10-09

LMArena 团队发布开源域文生图后训练配方:组合两类互补奖励信号——基于大规模人类偏好数据、Bradley-Terry 目标训练的偏好奖励,以及显式评估提示忠实性并防范 reward hacking 的细则(rubric)奖励。

关键难点是异构奖励的合成:简单加权平均导致次优优化,他们提出更有效的奖励组合策略平衡偏好优化与细则满足。在 Arena 文生图榜单上,RL 训练的 Flux2dev 比基座高 69 Elo;后训练的 Ideogram-4 以 1223.5 Elo 超过榜单所有开源模型(基于 2026 年 9 月 4 日榜单快照)。团队还开源了 1K 子集 Arena-T2I-Training 以复现部分收益。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →