NVIDIA 发布免编码器统一多模态模型 PixelUMM

NVIDIA 与滑铁卢大学团队合作发布 PixelUMM,一个免编码器的统一多模态模型,直接在像素空间同时完成图像与视频的理解与生成,去除了 VAE 与视觉编码器,代码和权重已开源。该模型基于 Qwen3-8B 微调,已在 Hugging Face 上架,旨在解决现有统一多模态模型架构的局限。

2026-10-02 ~ 2026-10-02 · 3 条相关