NVIDIA 发 PixelUMM:免编码器统一图像视频理解与生成
nvidia · hf · 2026-10-02
NVIDIA 发布 PixelUMM,一个免编码器(encoder-free)的统一多模态模型,直接在像素空间同时完成图像与视频的理解和生成。
- 动机:现有统一多模态模型(UMMs)通常为理解与生成使用分离的视觉表示,拉长视觉上下文并难以接入主流视觉-语言预训练管线;像素空间建模虽提供免编码器路线,但从图像扩展到视频并不直接——两者的时间表示不同
- 方法:图像表示为空间 patch,视频表示为时空 tubelet,通过单层线性投影接入共享多模态骨干;采用 Mixture-of-Transformers 架构(共享注意力 + 任务专用参数),将 clean-pixel 预测扩展到视频生成,联合支持自回归文本预测与像素空间 flow matching
- 结果:在图像与视频的理解和生成任务上均取得有竞争力的表现,并对解码器设计、时空 patch 尺寸等关键选择做了消融研究
所属事件:NVIDIA 发布免编码器统一多模态模型 PixelUMM(3 条相关)→
「多模态」频道最新
- 一条 prompt 让 Claude Opus 5.5 自主拍出 5 分半 AI 恐怖短片 — Cheap_Credit_3957 · 2026-10-02
- 放弃完美像素:作者用 MiniMax H3 在 3060 上 6 分钟产出 15 秒镜头 — Support_Marmoset · 2026-10-02
- MachGen 让 MiniMax H3 突破 15 秒上限,实现 30 秒连续视频 — MiniMax_AI · 2026-10-02
- NVIDIA 等发布 PixelUMM:去 VAE 与视觉编码器的像素空间统一多模态模型 — CSProfKGD · 2026-10-02
- FLUX 3 Image 发布:像素级控制、多轮精修、4K 与 10 张参考图 — Friendly-Fig-6015 · 2026-10-02
- 换一种提示词写法,视频角色从「会动」变成真正「会表演」 — FinanceYF5 · 2026-10-02