Arena 详解文生图后训练:500 万人类偏好票+VLM 自动 rubric 奖励

arena · x · 2026-10-02

Arena 发布博客详解其文生图模型后训练方法:在约 500 万对人类偏好投票上训练奖励模型,并用视觉语言模型自动构建 rubric,评估图像是否遵循 prompt、满足约束、避免已知 reward-hacking 行为。核心问题是「优化什么奖励」:仅靠人类偏好不够,图像可能好看却漏对象、加未要求内容或风格漂移。

结果:后训练 FLUX.2-dev 在 Arena 实时 T2I 榜单涨 69 分升至第二;后训练 Ideogram 4 得 1224 分,超越所有已列公开开源模型。博客还包含 rubric 奖励的构建方式、完整离线评估设置,以及捕获到的 reward-hacking 失败模式的前后视觉对比。

所属事件:Arena 公布文生图后训练新法,FLUX.2-dev 涨 69 Elo(2 条相关)→

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →