LMArena 后训练配方:偏好+细则奖励组合,Flux2dev Elo 提升 69 分
lmarena-ai · hf · 2026-10-09
LMArena 团队发布开源域文生图后训练配方:组合两类互补奖励信号——基于大规模人类偏好数据、Bradley-Terry 目标训练的偏好奖励,以及显式评估提示忠实性并防范 reward hacking 的细则(rubric)奖励。
关键难点是异构奖励的合成:简单加权平均导致次优优化,他们提出更有效的奖励组合策略平衡偏好优化与细则满足。在 Arena 文生图榜单上,RL 训练的 Flux2dev 比基座高 69 Elo;后训练的 Ideogram-4 以 1223.5 Elo 超过榜单所有开源模型(基于 2026 年 9 月 4 日榜单快照)。团队还开源了 1K 子集 Arena-T2I-Training 以复现部分收益。
「多模态」频道最新
- 开源 huashu-art-motion:35 种艺术风格让画动起来,单条动画报价数百到千元 — AlchainHust · 2026-10-09
- VOCALOID7 AI Megpoid 预售:中岛爱声源,8 种声线可切换 — CurieuxExplorer · 2026-10-09
- Iris-3B 开源:像素空间生成与通用视觉学习模型发布 — Total-Resort-3120 · 2026-10-09
- TerraVis:用 MLLM 工作流量化文生图的「世界一致性」缺陷 — the-aiml · 2026-10-09
- 听声音就能认出 Opus 生成的视频,音画同步节奏成新指纹 — hudzah · 2026-10-09
- 孙悟空骑虎下山:AI 视频再现《大圣归来》级国风名场面 — lucky-plume · 2026-10-09