Arena 公布文生图后训练新法,FLUX.2-dev 涨 69 Elo
Arena 团队发布博客详解文生图模型后训练新方法,指出仅靠人类偏好奖励并不充分,偏好模型会奖励看似漂亮却漏细节、添加无关内容甚至 reward-hacking 的输出。其方案在约 500 万对人类偏好投票上训练奖励模型,并用视觉语言模型自动构建 rubric,检查图像是否遵循 prompt、满足约束等,将偏好与评分表组合成复合奖励。该方法应用于 FLUX.2-dev 后训练后,Arena Elo 提升 69 分。
2026-10-02 ~ 2026-10-02 · 2 条相关
- Arena 用偏好+评分表组合奖励后训练 FLUX.2-dev 涨 69 Elo — arena · 2026-10-02
- Arena 详解文生图后训练:500 万人类偏好票+VLM 自动 rubric 奖励 — arena · 2026-10-02