UniSpace:无需 VAE 的统一视觉表示与多模态建模
meituan-longcat · hf · 2026-08-24
UniSpace 提出了一种重参数化的预训练视觉 Transformer,在单一视觉空间内统一了语义理解、高保真重建和图像生成。该方法无需单独的 VAE,实现了可扩展的多模态建模。
「多模态」频道最新
- MiniMax-H3 Fun Controlnet Union 模型发布 — physalisx · 2026-08-24
- Seedance 2.5生成30秒原生视频,Magnific控制3D运动与4K — mhdfaran · 2026-08-24
- AI 生成 1974 年婚礼对话:爷爷有六根手指? — mhdfaran · 2026-08-24
- 实测 MiniMax Music 3 生成赛博朋克 2077 歌曲 — Ok-Entertainer-2991 · 2026-08-24
- H3 模型 T2V 多重扩散实验:5 小时渲染作品展示 — SIR_NVAX_A_LOT · 2026-08-24
- Grok 4.6 复刻《黑客帝国》ASCII 码画面 — Daniel_Farinax · 2026-08-24