仅用 120 万张 ImageNet 训出 T2I 模型,GenEval 追平 FLUX
serrjoa · x · 2026-09-08
arXiv 论文(2502.21318,Degeorge 等)挑战「数据越多越好」的 T2I 训练范式:只用约 120 万张 ImageNet 图片,配合精细的重新打标(recaptioning)和 CutMix 图像增强,就能训出与 FLUX-dev 相当的通用文生图模型。
- 在 GenEval 上达到 0.67,与 FLUX-dev 持平,整体得分超 SD3 约 +5;DPGBench 超 SDXL +12
- 训练图片量仅为常规网络抓取数据集的 1/1000,参数量少 3-10 倍
- 全套标准化训练仅需 500 H100 小时,且 ImageNet 公开可得,可复现性远超网络爬取数据
作者结论:数据设计(caption 质量与增强策略)比单纯堆数据规模更关键,为可复现研究开了新路。
「多模态」频道最新
- 开源 3D 纹理绘制软件 ArmorPaint 历经 7 年终于发布 1.0 — petewoodbridge · 2026-09-08
- Blender+GPT-6 Astra+H3 视频组合技:AI 生成 3D 再动起来 — Hailuo_AI · 2026-09-08
- 一条 prompt 复刻 Higgsfield 动画短片演示:本地 MiniMax H3 + Blender 全流程 — Hailuo_AI · 2026-09-08
- GPT Astra 看图建 Blender 地牢,再用 MiniMax H3 生成穿越视频 — Hailuo_AI · 2026-09-08
- 图片到可交互 3D 网页:Hyper3D+Three.js+AI 编码全流程实测 — TheMoonMidas · 2026-09-08
- 网友称 Astra 一举颠覆所有视频剪辑工具 — _AustinCalvert_ · 2026-09-08