Arena 用偏好+评分表组合奖励后训练 FLUX.2-dev 涨 69 Elo

arena · x · 2026-10-02

Arena 团队发布文生图模型后训练新方法:人类偏好奖励必要但不充分,偏好模型仍会奖励看似漂亮却漏细节、加无关内容或 reward-hacking 的输出。其复合奖励包括:

效果:后训练 FLUX.2-dev 在其 T2I 实时榜涨 69 Elo 达 1202;Ideogram 4 涨 20 Elo 至 1224,超越所有已列公开开源模型。离线消融(Gemini 3.5 Flash 当裁判)显示各奖励组件互补,偏好之上加忠实度和约束奖励后对基础模型胜率达 64.2%,再把有无反 reward-hacking 目标的策略在权重空间集成后升至 66.0%。

所属事件:Arena 公布文生图后训练新法,FLUX.2-dev 涨 69 Elo(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →