Arena 详解文生图后训练:500 万人类偏好票+VLM 自动 rubric 奖励
arena · x · 2026-10-02
Arena 发布博客详解其文生图模型后训练方法:在约 500 万对人类偏好投票上训练奖励模型,并用视觉语言模型自动构建 rubric,评估图像是否遵循 prompt、满足约束、避免已知 reward-hacking 行为。核心问题是「优化什么奖励」:仅靠人类偏好不够,图像可能好看却漏对象、加未要求内容或风格漂移。
结果:后训练 FLUX.2-dev 在 Arena 实时 T2I 榜单涨 69 分升至第二;后训练 Ideogram 4 得 1224 分,超越所有已列公开开源模型。博客还包含 rubric 奖励的构建方式、完整离线评估设置,以及捕获到的 reward-hacking 失败模式的前后视觉对比。
所属事件:Arena 公布文生图后训练新法,FLUX.2-dev 涨 69 Elo(2 条相关)→
「多模态」频道最新
- 实测:ComfyUI v0.38 让 MiniMax H3 图生视频提速至少 16% — mwhjose · 2026-10-03
- LTX 2.3 速度快但常无视提示词,CivitAI 上 LoRA 也渐少 — Fit_Satisfaction2953 · 2026-10-03
- Reddit 用户用 Opus 5+Seedance 造出动漫 AI 僚机 demo — EndlessMendless · 2026-10-03
- AI 视频真实度到哪一步了?Reddit 热议配真机实拍对比 — Solar-Guardian · 2026-10-03
- KAIST 推出 World Observer:全景观察者让世界模型看视野外世界 — Scobleizer · 2026-10-03
- EgoTools 发布:百小时第一视角视频教 AI 理解工具使用 — liuziwei7 · 2026-10-03