五百万票叠清单奖励,FLUX.2 Elo 涨 69

Post-Training Frontier Text-to-Image Models by Composing Preference and Rubric Rewards

Yuanhao Ban, I-Hung Hsu, Anastasios Angelopoulos, Wei-Lin Chiang, Ion Stoica, Cho-Jui Hsieh

cs.CV, cs.AI

2026-10-02

约 560 万条 Arena 真人票训出偏好奖励,叠上忠实度清单和意图门控,再用 DiffusionNFT 把 FLUX.2-dev 的 Elo 从 1132.8 抬到 1202,Ideogram-4 推到 1223.5,超过 2026 年 9 月 4 日榜上全部开源模型。

这篇在解决什么

文生图底模已经很强,后训练还能抬多少,取决于奖励能不能同时盖住两件事:人喜不喜欢这张图,以及提示词里很少被投票点到的硬条件。PickScore、HPSv2 把人类对比压成一个分数,美学抓得住,「物体齐、风格不漂、别乱写字」基本看不见。

只优化偏好分,奖励还在涨,画面先到顶再变差。FLUX.2-dev 对着 Arena 自训奖励和 PickScore 都是这个走势。只优化忠实度,细节和指定风格会被洗平。几路分数直接相加,数值大的一路抢梯度,模型还会去讨好检测器。

方法

后训练用 DiffusionNFT,在前向扩散过程上更新策略。当前策略和旧策略配出一对更好、更差的速度场,奖励高往正例拉,奖励低往负例推。同一提示抽一组图,权重只看组内高低。底模冻结,只训 LoRA。

偏好奖励是 Bradley-Terry 模型:Qwen3.6-27B 在句末分类 token 上接线性头,输出 logit。训练对来自 Arena,2025 年 4 月 16 日到 2026 年 6 月 7 日,约 560 万对真人投票,覆盖 100 多个文生图模型。训练时加了颜色抖动和像素噪声,减弱对低层图像统计的依赖。

忠实度看提示要求的内容在不在。gemini-3-pro-preview 把 1 万条训练提示拆成 18.2 万道是否题,Qwen3.6-27B 作答,奖励是答「是」的比例。约束看不该出现的内容,包括写明的否定,也包括「极简」这种多画一件就跑题的意图。gemini-3.1-pro-preview 写了 2.6 万道约束题,同一个裁判打分。

防刷分检测只做否决。乱码文字看单张图。非照片风格被改成电影感照片,则与冻结底模的同提示出图对比,正反顺序各判一次。报违规时削掉该样本偏好分的正分,负分保留;没有违规不加分。避开检测器没有好处,否则讨好检测器会变成新目标。

偏好和忠实度始终生效。约束只在意图为 strict 时生效,开放式提示不多罚。印象派公路上多一朵花不算错。两位作者盲标 400 条,三分类一致率 77.8%,门控用的二分类一致率 89.5%。各路先在 batch 内分开标准化,再以权重 1 相加。

Stage 1 含偏好、忠实度、门控约束。Stage 2 加上否决重训。Stage 3 把两版 LoRA 增量等权平均。提示滤掉改图、过短、冷门专名和非英文后,训练 1 万条、验证 1 千条。FLUX.2-dev 为 320 亿参数,每步 48 组、每组 24 张,10 步、512 分辨率、CFG 4.0。Ideogram-4 为 93 亿参数,组规模相同,引导权重 7.0。

结果

离线按 MMRBv2,在 1 千条验证提示上由 gemini-3.5-flash 与冻结底模两两对比,GPT-5.4 复判。检查点取 30 到 150 步中 Gemini 胜率最高者。推理分辨率 1024。下表是 FLUX.2-dev 的 Gemini 胜率。

方法Arena 偏好模型PickScore
DiffusionNFT 原配方0.2900.290
只训忠实度0.3660.366
只训偏好0.5070.461
Arena-T2I-Hard0.5890.577
Stage 10.6420.581
Stage 20.6350.571
Stage 30.6600.626

Arena-T2I-Hard 只有偏好和忠实度。DiffusionNFT 原配方分阶段混入 PickScore、HPSv2、CLIPScore、GenEval 和 OCR,胜率 0.290。GPT-5.4 给 Stage 3 的数字是 0.572 与 0.623。

Stage 1 明确输给底模 204 条,Stage 2 为 234 条,交集 92 条。Stage 1 赢在构图(65%)和风格(16%),Stage 2 赢在忠实度(16% 对 9%)和干净文字(9% 对 3%)。平均后,Stage 3 在两边各自独输的题上胜率 0.560 和 0.397,两边都输的题上还有 0.304。同一运行里平均检查点,Arena 偏好模型下为 0.6435,跨配方平均为 0.6598;PickScore 从 0.5610 到 0.6256。

防刷分做成加分项时,Arena 偏好模型的 Gemini 胜率是 0.5260,PickScore 是 0.4194。改成单向否决后,分别是 0.6346 和 0.5710。约束不设门控时,这两列是 0.6046 和 0.5200,设上门控后是 0.6416 和 0.5810。检测器不管提示是否适用时,Arena 偏好模型为 0.5591,加上适用性门控为 0.6346;PickScore 几乎不动,从 0.5695 到 0.5710。

奖励模型的票数会进到后训练结果。1 万对投票时 Stage 1 胜率 0.537,10 万对 0.607,50 万对 0.611,全量约 560 万对 0.642。

Ideogram-4 只做 Stage 1,并加了 OCR 奖励,因为后训练伤文字渲染,且没看到稳定刷分。在 Gemini 上、用 Arena 偏好模型时,只训偏好的胜率是 0.266,Arena-T2I-Hard 为 0.401,加上门控约束到 0.553。GPT-5.4 用同一偏好模型复判 Stage 1 为 0.623。

真人盲测的快照日是 2026 年 9 月 4 日。FLUX.2-dev 从 1132.8±14 到 Stage 1 的 1190.3,再至 Stage 3 的 1202.1(榜上记为 1202±13),大约高 69 分。Ideogram-4 的 Stage 1 为 1223.5,底模兼此前开源最高的 Ideogram-4.0-Quality 是 1204±4,落后 19.5。nano-banana-2、seedream-5.0-pro、nano-banana-pro 仍是 1261±5、1258±4、1232±5。

1 千条公开子集配 PickScore,Stage 1 和 Stage 3 的 Gemini 胜率是 0.566 和 0.615,全量 1 万条上是 0.581 和 0.626。

为什么重要

FLUX.2-dev 和当时开源榜第一的 Ideogram-4,用同一套不搜权重的配方都超过了各自底模。能复用的是组合方式:按轴标准化,约束看意图开关,刷分只否决,两版 LoRA 直接平均。换成公开的 PickScore,Stage 3 仍有 0.626。1 千条子集能收回大部分离线胜率。560 万对投票训出的奖励模型,以及线上那 69 分,这份子集给不了。

局限与存疑

只测了两个底模,没有带工具的多步场景,忠实度拆题没有人工审核,只报一个随机种子。这是论文自己写明的。

离线分是语言模型在评语言模型。拆题和意图标签来自 Gemini,清单裁判是 Qwen3.6-27B,最佳检查点由 gemini-3.5-flash 选出。消融没有对应的真人 Elo。Ideogram-4 离线只到 0.553,线上只加 19.5 分,幅度比 FLUX.2-dev 小很多。训练在 512 分辨率采样,评测和上线在 1024。

防刷分来自 Stage 1 的 205 个失败案例,只盖住乱码文字和照片风漂移。DiffusionNFT 原配方的 0.290 偏低,那套日程原是为另一批提示写的。正文把「高出 7.1 和 4.9 个百分点」写在 Stage 1 的讨论里,这组差实际对应 Stage 3 对 Arena-T2I-Hard 的 0.660 对 0.589、0.626 对 0.577。Stage 1 自己大约高 5.3 和 0.4 个百分点。名次锁定在 9 月 4 日的快照。

术语

原文与代码

相关论文

全部论文解读