华科团队提出 Multimodal Flow:语言与视觉的全连续统一建模
hustvl · hf · 2026-10-02
华中科技大学团队(hustvl)发布 Multimodal Flow,一个语言与视觉完全连续的统一生成模型,代码与模型开源。
- 动机:现有统一多模态模型要么把文本和图像都离散化(视觉量化瓶颈),要么离散语言+连续图像(目标与采样流程因模态而异)。全连续建模可避免两种取舍,此前探索不足。
- 方法:将文本块与图像组织为有序的连续 hyperchunk,共享 chunk-causal flow 骨干通过 Flow Matching 学习单一向量场;联合注意力实现跨模态交互,各模态使用独立 FFN;训练并行预测多个目标 chunk,推理顺序生成。
- 结果:训练 MF-1(0.6B/1.2B/1.6B),仅用 150B token 预训练,GenEval+DPG-Bench 平均 82.8 分,VQAv2/MMBench/POPE 平均 75.3 分,与用更多数据训练的统一模型相当;同预算下超越代表性混合与离散方案,验证连续 chunk embedding flow 作为统一多模态新范式。
「多模态」频道最新
- 两只白鸭的「严肃对话」:AI 生成视频又一名场面 — misovalko · 2026-10-02
- 腾讯混元 Tex-Zero:不靠 3D 资产,纯用 2D 图像训练 3D 纹理生成 — Tencent-Hunyuan · 2026-10-02
- 一条提示词生成 AAA 级 3D 鲁布·戈德堡机器动画 — imjustnewatai · 2026-10-02
- Seedance 2.5 生成千禧年 DV 质感视频,超写实度引热议 — SimplyAnnisa · 2026-10-02
- ComfyUI 分段视频口型同步:先剪辑还是先 sync? — Positive_Society1876 · 2026-10-02
- AI 视频推镜怎么写 prompt:dolly 还是 zoom? — Classic-Jellyfish-26 · 2026-10-02