Meta 发布 FLAT:图文统一 1D 表征,T2I GenEval 达 71.1
meta · hf · 2026-09-17
Meta 发布 FLAT(Flexible-Length Aligned Transmodal representations),一个将多模态表征学习与生成联合训练的预训练框架。
核心思路
- 传统做法分两阶段:先训对比/自监督视觉编码器,再接生成模型,生成性能受制于冻结的表征。FLAT 用单一预训练阶段,联合优化共享多模态编码器与下游文生图(T2I)、图生文(I2T)解码器,结合对比对齐与双向跨模态生成目标。
- 架构上把视觉与文本输入映射到统一的连续 1D 序列空间,并对 prefix-K token 施加 nested dropout,实现动态可变输出长度,表征可被生成解码器直接消费。
成绩
- 零样本 T2I 生成 GenEval 71.1
- 任务微调后:T2I GenEval 83.1;MS-COCO 图像描述 40.5 BLEU-4 / 138.6 CIDEr;检索 Recall@5:MS-COCO 86.8(I2T)/ 75.8(T2T2I),Flickr30K 98.3 / 93.6
定性结果显示 FLAT 表征原生支持线性插值、隐空间算术与零样本组合检索。
「多模态」频道最新
- HunyuanVideo 1.5 生成黑屏:仅特定帧长有画面,求解排查 — Big-Maybe-2228 · 2026-09-17
- QuiverAI 发布 Arrow 2:生成可精确编辑的矢量图形 — stuffyokodraws · 2026-09-17
- SuperSplat 新增场景 splat 数量查看,旧场景将回填 — willeastcott · 2026-09-17
- LoRA 训练工具 ai-toolkit 上架 Pinokio,支持一键安装 — cocktailpeanut · 2026-09-17
- Spotify AI 身份徽章仅针对照片级 AI 假身份,不动版税池 — mixtapedmonk · 2026-09-17
- 用 AI 建模 Blender 的技巧:分部件建模再拼装更有效 — kevinkern · 2026-09-17