Arena 用偏好+评分表组合奖励后训练 FLUX.2-dev 涨 69 Elo
arena · x · 2026-10-02
Arena 团队发布文生图模型后训练新方法:人类偏好奖励必要但不充分,偏好模型仍会奖励看似漂亮却漏细节、加无关内容或 reward-hacking 的输出。其复合奖励包括:
- 基于 560 万对人类投票训练的 Bradley-Terry 奖励模型
- 由 VLM 依据自动生成 checklist 评估的忠实度奖励
- 覆盖显式与隐式用户意图的约束奖励
- 针对乱码文字、照片真实感漂移等失败模式的反 reward-hacking rubric 奖励
效果:后训练 FLUX.2-dev 在其 T2I 实时榜涨 69 Elo 达 1202;Ideogram 4 涨 20 Elo 至 1224,超越所有已列公开开源模型。离线消融(Gemini 3.5 Flash 当裁判)显示各奖励组件互补,偏好之上加忠实度和约束奖励后对基础模型胜率达 64.2%,再把有无反 reward-hacking 目标的策略在权重空间集成后升至 66.0%。
所属事件:Arena 公布文生图后训练新法,FLUX.2-dev 涨 69 Elo(2 条相关)→
「多模态」频道最新
- 16GB 显存本地跑通 LTX 2.5 生成完整 MV,效果出乎意料 — sokmech · 2026-10-02
- Eleven v4 角色动画演示:音频驱动角色口型与表演 — buraktuyan · 2026-10-02
- 让 Claude 当导演:Fable 5.1 自主产出一支超现实主义 AI MV — cheetoskull · 2026-10-02
- Krea 2 Turbo 一体化 ComfyUI 工作流:2/4 步 LoRA 提速出图 — TimeTruth2490 · 2026-10-02
- 全队没人会用 Blender,靠 Claude 跑通整套 3D 电影工作流 — gen_ericai · 2026-10-02
- Meshy 预告 3D 局部编辑:选中区域输入文字即可改 — rms80 · 2026-10-02